Supabase Evals 开源框架
2026 年 8 月 1 日,Supabase 发布。
评测套件
| 套件 | 用途 |
|---|---|
| benchmark | 标准能力评测 |
| regression | 回归测试 |
| other | 其他场景 |
运行模式
- 本地模式:CLI 接口,bash 脚本
- 远程模式:项目级评测
关键发现
"Agent 倾向于手写迁移而非声明式 schema"
这揭示了 AI 编码 Agent 的重要行为模式——更倾向于显式代码而非抽象声明。
技术架构
- 每个评测包含 PROMPT.md、EVAL.ts、project.sql
- 支持实验套件选择(benchmark、no-skills)
- 结果可导出为 JSON 供 Web 应用展示
行业影响
- 评测标准化:首个 Agent 专用评测框架
- 行为洞察:揭示 Agent 编码偏好
- 能力对比:为 Agent 产品提供可复现评测
AI Master 解读
核心事件
Supabase 开源 Evals 框架,首个面向 AI 编码 Agent 的基准评测系统。
行业影响
为什么重要: AI 编码 Agent 评测一直缺乏标准化框架。Supabase Evals 填补了这一空白,为 Agent 能力评估提供可复现的方法论。
关键发现: 框架包含 benchmark、regression 和 other 三类评测套件,支持本地和远程运行模式。研究发现 AI Agent 倾向于手写迁移而非声明式 schema,揭示了 Agent 编码模式的重要特征。
影响分析: Agent 评测标准化推动了行业能力对比和基准建立。发现 Agent 编码偏好为理解 AI 编码行为提供了新视角。这将促进 AI 编码 Agent 产品的快速迭代和优化。
AI Master 建议
使用 Supabase Evals 评估 AI 编码 Agent;关注 Agent 编码模式研究。
