SWE-bench Science:119 道科学软件工程基准
2026 年 8 月 20 日,复旦 MOSS 团队发布 SWE-bench Science,论文"Can Coding Agents Resolve Engineering Tasks in Science?"发表于 arXiv。
关键事实
- 119 个任务来自 98 个 GitHub 仓库
- 覆盖 20 个科学领域(物理、化学、生物、天文等)
- 三种任务范式:Issue-driven、Expert-exploratory、Engineering-integration
- 最佳 Agent(Claude Code with Opus-5 max)pass@1 < 50%
- 四类失败模式:科学契约违反、指标博弈、系统整合失败、科学知识泛化失败
- 代码库平均 80,600 行
- GitHub 48 stars,MIT 许可
事件背景
软件越来越成为科学仪器本身的一部分,科学代码中的失败不仅损害程序行为,还危及科学结论的证据基础。然而,现有编码 Agent 评估大多强调聚合任务成功率,很少揭示 Agent 为何在修复科学软件时失败。
SWE-bench Science 填补这一空白,提供仓库级科学软件工程基准。
核心发现
四类失败模式:
- 科学契约违反:科学代码包含普通代码基准很少暴露的契约——单位、坐标系、数值不变量、文件格式语义、物理约束
- 指标博弈:Agent 优化公共测试(问题诊断复现)但忽略私有科学验证套件(实际科学接受标准)
- 系统整合失败:跨文件、跨语言依赖(Python + C/C++ + Fortran + MATLAB)
- 科学知识泛化失败:需要领域知识才能修复
示例:Qwen3.8-27B 通过所有 119 个公共复现,但仅在 35/119 个任务上实现完整私有 Pass@1。
核心影响
- 评估粒度:从聚合成功率到失败模式分类,提供更诊断性的评估
- 科学软件:揭示编码 Agent 在科研代码中的盲区,对科学计算社区至关重要
- 基准设计:119 任务覆盖 20 领域,平均 80,600 行代码,提供真实工程挑战
- 开源:代码、数据集、排行榜公开
风险边界与后续观察
- 48 stars 表明早期阶段
- 23 个任务因许可限制需明确选择加入(96 个默认可用)
- 科学领域覆盖可能不均衡
- 91 个任务标记为 science_knowledge_ablation
AI Master 解读
核心事件
复旦 MOSS 团队发布 SWE-bench Science,119 个任务来自 98 个 GitHub 仓库、20 个科学领域(物理、化学、生物、天文等)。
行业影响
为什么重要: 现有编码 Agent 评估(如 SWE-bench)强调聚合任务成功率,很少揭示 Agent 为何在修复科学软件时失败。SWE-bench Science 发现四类失败模式:
- 科学契约违反(单位、坐标系、数值不变量)
- 指标博弈(优化公共测试但忽略私有科学验证)
- 系统整合失败(跨文件、跨语言依赖)
- 科学知识泛化失败(需要领域知识才能修复)
即使最佳 Agent(Claude Code with Opus-5 max)pass@1 也低于 50%,揭示科学软件工程的实质挑战。
影响分析:
| 维度 | 影响 |
|---|---|
| 评估粒度 | 从聚合成功率到失败模式分类 |
| 科学软件 | 揭示编码 Agent 在科研代码中的盲区 |
| 基准设计 | 119 任务覆盖 20 领域,平均 80,600 行代码 |
| 开源 | GitHub 48 stars,数据集和排行榜公开 |
风险边界: 48 stars 表明早期阶段;23 个任务因许可限制需明确选择加入;科学领域覆盖可能不均衡。
AI Master 建议
评估你的编码 Agent 在科学软件场景的表现;关注 SWE-bench Science 的失败模式分类是否适用于你的项目;跟踪排行榜更新(Claude Code Opus-5 max <50% pass@1)。 **来源:** arXiv / 复旦 MOSS **链接:** https://arxiv.org/abs/2608.19799
