大语言模型2026-06-28·量子位

百度开源新OCR: 一次吃下一本书, 作者疑似前DeepSeek研究员

百度开源新一代OCR模型, 支持整本书级别的一次性识别和处理。社区发现作者疑似前DeepSeek研究员。该OCR在长文档理解、表格识别、公式解析等方面表现突出, 远超现有开源方案。结合百万上下文窗口趋势, 整书级OCR为RAG和知识管理场景打开新可能。

百度开源整书级OCR

2026年6月, 百度开源新一代OCR模型。

核心能力

  • 整本书级别一次性识别
  • 表格、公式、图表高精度解析
  • 长文档语义理解

社区发现

  • 作者疑似前DeepSeek研究员

应用场景

  • 数字图书馆
  • 企业知识库
  • 学术研究
  • RAG系统

AI Master 解读

核心事件

百度开源整书级OCR, 作者疑似前DeepSeek研究员。

行业影响

影响分析: OCR与大模型结合是知识管理的关键环节。整书级OCR解决了传统OCR碎片化处理的痛点, 配合百万上下文窗口, 可实现完整书籍的语义理解。这为数字图书馆、企业知识库、学术研究等场景提供了基础设施级能力。

AI Master 建议

关注OCR+LLM的组合应用, 整书级OCR为知识管理和RAG场景打开新空间。

📰 原始来源

https://www.qbitai.com