百度文心助手任务 Agent 登顶 PinchBench v2
2026 年 7 月 22 日,量子位报道百度文心助手任务 Agent 在国际榜单夺冠。
榜单成绩
| 排名 | 模型/系统 | 得分 |
|---|---|---|
| 1 | 百度文心助手任务 Agent | 最高 94.6% / 平均 94.4% |
| 2 | Claude Opus 4.8-fast | 93.5% |
| 3 | Qwen3.7-max | 92.5% |
| 4 | Claude Opus 4.8 | 90.5% |
| 5 | GPT-5.6-luna | 88.7% |
PinchBench 是什么
- 由 Kilo AI 推出、OpenClaw 社区维护
- 23 个真实工作场景、147 项任务、617 次测试运行
- 覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类
- 「自动化校验 + LLM 评审」双轨机制,零人工干预
- 衡量模型 + Agent 框架的综合能力
备注
- 百度 AI 搜索团队已开源评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation)
- 榜单为厂商披露口径,建议结合评测维度理性参考
AI Master 解读
核心事件
百度文心助手任务 Agent 登顶 PinchBench v2 全球工程向智能体榜单。
行业影响
PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,区别于 MMLU、GPQA 等「考模型知不知道」的传统基准,它考的是「智能体能不能把整件事做完并交付可验证结果」。当前版本含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化等七大类,采用「自动化校验 + LLM 评审」双轨机制。
文心助手以最高分 94.6%、平均分 94.4% 在 59 个模型中登顶,领先 Claude Opus 4.8-fast(93.5%)、Qwen3.7-max(92.5%)、Claude Opus 4.8(90.5%)、GPT-5.6-luna(88.7%)。值得注意的是,PinchBench 衡量的是模型与 Agent 框架的综合能力——同一底座搭载不同框架得分差异显著,因此榜首代表的是「模型 + 系统工程」的协同实力。百度已在 GitHub 开源完整评测流程。
榜单类成绩需结合评测维度理性看待,但 PinchBench 强调「可验证交付」的工程导向,对实际生产力有较强参考价值。
AI Master 建议
评估 Agent 产品时应关注「端到端任务完成率」而非单一模型跑分;开发者可参考开源的 PinchBench-Evaluation 流程自建任务级评测,衡量自身 Agent 框架在真实工作流中的表现。
