Tesseract OCR
开源 OCR 引擎,73,620+ stars。由 HP 开发、Google 维护的顶级文字识别引擎,支持 100+ 语言,可识别图片、PDF、扫描件中的文字。结合 LSTM 神经网络实现高精度 OCR,是 AI 文档处理的基础设施。
🎯适用场景:多模态内容理解与生成
#OCR#文字识别#文档处理#多语言
📊 仓库数据
Stars75,882
Forks10,739
语言C++
上线2015/1/1
更新2026/8/13
📈 Stars 变化 ↑1 天 +22· 统计区间 8/12 03:47 → 8/13 04:33(1 天)
✅ 优点
- •支持 100+ 语言
- •Google 维护更新
- •LSTM 神经网络识别
- •CLI 和 API 均可用
⚠️ 限制
- •手写体识别较弱
- •复杂布局需预处理
- •中文识别精度待提高
