Cocoindex
面向长周期 AI Agent 的增量计算引擎,支持状态管理和增量数据处理,是构建长期运行 Agent 基础设施的核心组件。
🎯适用场景:数据采集与 ETL 处理
📥 收录于 2026/5/11
📊 仓库数据
✅ 优点
- •原生 Agent 编排与工具调用
- •9.9K+ stars
- •开源免费
⚠️ 限制
- •需要 Python 运行环境
- •检索效果依赖文档质量与分块策略
- •文档与社区支持因项目而异
🔗 相关工具
unstract
github.com/Zipstack/unstract
LLM 驱动的非结构化数据提取工具,面向 API 部署和 ETL 管道工作流。支持从 PDF、发票、合同等文档中自动提取结构化数据,适合企业级文档处理场景。6.6K+ stars。
🎯企业文档自动处理、发票/合同信息提取、RAG 数据管道构建
MarkItDown
github.com/microsoft/markitdown
微软开源的通用文件转 Markdown 工具,支持 PDF、Word、PPT、Excel、HTML、音频、图片 OCR 等数十种格式转换,专为 LLM 和 RAG 数据预处理设计,插件系统可扩展,MIT 协议
🎯多模态内容理解与生成
Supabase
github.com/supabase/supabase
Postgres 开发平台,101,199+ stars。开源 Firebase 替代方案,内置向量数据库支持 pgvector,是构建 AI 应用(RAG、Agent)的理想后端基础设施。提供实时数据库、认证、存储、Edge Functions 等全栈能力。
🎯LLM 应用快速开发
China Textbook
github.com/TapXWorld/ChinaTextbook
收录所有小初高、大学 PDF 教材(GitHub 69k 星),覆盖中国完整教育体系,是 AI 教育应用和知识库构建的重要数据源
🎯中文 PDF 教材数据集、教育领域知识库构建
AFFiNE
github.com/toeverything/affine
开源、本地优先、隐私友好的 Notion 和 Miro 替代品,集知识库、文档、白板、数据库于一体的全功能工作空间
🎯个人/团队知识库搭建、文档管理、白板协作、替代 Notion
Meilisearch
github.com/meilisearch/meilisearch
AI 混合搜索引擎,57,234+ stars。开源、快速、易用的全文搜索引擎,支持 AI 语义搜索和传统关键词搜索混合使用,毫秒级响应,提供开箱即用的搜索体验
🎯知识库问答与 RAG 检索