DeepSWE 基准发布:113 个长周期软件工程任务
2026 年 8 月 21 日,Datacurve AI 官方。
事件背景
Datacurve AI 是一家专注于前沿编码数据的公司(YC 背景,4 人团队,旧金山)。DeepSWE 是其发布的编码代理基准,旨在评估 AI 代理在真实软件工程任务的表现。
关键事实
- 任务数量: 113 个原创长周期软件工程任务
- 语言覆盖: TypeScript、Go、Python、JavaScript、Rust
- 污染控制: 明确排除预训练数据污染
- 代理支持: claude-code、codex、gemini-cli、opencode 等
- GitHub stars: 1,453
- 协议: Apache 2.0
技术机制
DeepSWE 的任务设计强调"长周期"——每个任务涉及多文件修改、跨模块依赖、真实工程约束(如测试覆盖、文档更新)。这与 SWE-bench 等基于 GitHub issues 的基准形成差异化,后者存在预训练污染风险(模型可能在训练数据中见过相关 issues)。
DeepSWE 还配套了 Pier 工具(Harbor fork),支持在 Docker 或 Modal 沙盒中并行运行代理评估。
影响与意义
DeepSWE 为编码代理评估提供了更干净、更贴近真实工程的框架。对开发者而言,基准结果可以作为选择编码代理的参考;对代理开发者而言,基准提供了明确的优化目标。
风险边界
- 113 个任务的覆盖范围有限,可能无法代表所有工程场景
- 基准结果需在具体项目中验证,不同代码库的复杂度差异显著
- Datacurve 作为 4 人初创公司,基准的长期维护和更新存在不确定性
后续观察
- DeepSWE 是否成为编码代理评估的行业标准
- 各代理在基准上的表现对比
- 基准任务的扩展和更新计划
- 是否有更多类似的高质量基准出现
AI Master 解读
核心事件
DeepSWE 发布 113 个长周期软件工程任务的编码代理基准。
行业影响
为什么重要: 现有编码基准(如 SWE-bench)多基于真实 GitHub issues,存在预训练污染风险。DeepSWE 采用原创任务设计,明确排除预训练数据污染,提供更干净的评估。长周期任务(涉及多文件修改、跨模块依赖)更贴近真实工程场景,能更好区分代理的实际能力。
影响分析:
| 维度 | 影响 |
|---|---|
| 评估纯净度 | 原创任务排除预训练污染,结果更可信 |
| 任务复杂度 | 长周期、多文件、跨模块,贴近真实工程 |
| 代理支持 | 覆盖 claude-code、codex、gemini-cli 等主流代理 |
| 行业价值 | 为编码代理提供标准化、可复现的评估框架 |
AI Master 建议
关注 DeepSWE 的评估结果,作为选择编码代理的参考;评估你的项目是否适合纳入类似基准;跟踪基准任务的覆盖范围和更新频率。
