Artificial Analysis Intelligence Index(AA 智能指数)
Artificial Analysis Intelligence Index第三方模型跑分榜
亦作、亦称:AA 智能指数 · AA Intelligence Index · Artificial Analysis Index · Intelligence Index
Artificial Analysis Intelligence Index 是第三方跨模型智能比较基准——用标准化任务集在真实 API 端点上测量 LLM 多维能力,输出 0-100 可比指数,是工程选型的稳定能力维度参照。
它量的是什么
AA Intelligence Index 用一组标准化任务(推理、编码、数学、知识、多语言等)在真实 API 端点上测量模型表现,输出 0-100 的单一指数。它不是单一 benchmark 的分数,而是多维任务的加权综合——目的是给出一个「能力维度」的横向可比数字,供工程选型时快速定位模型档位。
与 LMSYS Chatbot Arena 的边界
LMSYS/Chatbot Arena 基于人类偏好投票(Elo 评分),反映「人觉得哪个更好」;AA Intelligence Index 基于标准化任务表现,反映「模型在可复现任务上做得多好」。两者互补:Arena 捕捉主观偏好与风格差异,AA Index 捕捉可复现的任务能力。选型时两者都看:Arena 高但 AA Index 低的模型可能「讨喜但不准」,反之可能「准但不讨喜」。
工程选型中的位置
AA Index 在模型选型中承担「能力维度」这一轴。完整选型需同时看:能力(AA Index / Arena Elo)、成本($/百万 token)、速度(TTFT、吞吐)、上下文(窗口长度)、合规(数据驻留、协议)。单看指数会忽略成本约束,单看成本会忽略能力门槛——面试题 model-pricing-selection-001 正是围绕这三轴的工程权衡展开。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「第三方模型跑分榜」
- 「AI 模型的综合评分」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计查看详解 →
在预算约束下,如何综合 Artificial Analysis Intelligence Index、$/token 价格与上下文窗口做模型选型?给出决策框架与真实对照案例
2026 年模型 API 选型不再是「选最强的」,而是「在预算约束下选最合适的」。本题考察候选人能否建立「能力(AA Intelligence Index)× 成本($/百万 token)× 上下文(窗口长度)」三轴决策框架,并用 Grok 4.6 平价追平(Index 61 vs $2/$6)与 Claude Sonnet 5 介绍价永久化($2/$10,news-7693)等真实案例做对照。与 agent-cost-engineering-001(Agent 成本工程)互补:后者解决「已经选了模型之后如何降本」,本题解决「选模型阶段如何权衡」。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
- 高级概念查看详解 →
比较 Subquadratic Attention 与标准 Self-Attention 的复杂度差异。长上下文 LLM 的工程挑战有哪些?
考察候选人对注意力机制复杂度的理解:标准自注意力为何是 O(n²)、亚二次注意力的实现路径(稀疏/低秩/线性/SSM)、SubQ 的工程突破,以及长上下文 LLM 在内存、延迟、成本上的工程挑战。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Artificial Analysis Intelligence Index」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
