Test-Time Compute Scaling(推理时计算缩放)
Test-Time Compute Scaling推理时多花算力换更强表现
亦作、亦称:推理时计算缩放 · Test-Time Compute Scaling · Test-Time Scaling · 推理时缩放
Test-Time Compute Scaling 是推理阶段通过增加计算量提升性能的技术范式——与 train-time scaling 互补,三种策略(token/sequence/trial-level),核心前沿是 Compute-Optimal(何时停止分配更多推理计算)。
核心定义与三种策略
Test-Time Compute Scaling 是在推理阶段通过增加计算量提升性能的技术范式,与 train-time scaling(堆参数/数据)互补。
三种缩放策略:
- Token-level:延长单条思维链(长 CoT),让模型在单次推理中思考更深更细
- Sequence-level:多路径采样 + 投票/验证(best-of-N、self-consistency),生成多条候选路径后择优
- Trial-level:完整试错 + 搜索(Tree-of-Thoughts、MCTS),显式探索多分支并回溯
三者不是互斥的,可组合使用。
Compute-Optimal 前沿
核心问题是:何时停止分配更多推理计算?收益边际递减——简单任务上长 CoT 或 best-of-N 只是徒增成本与延迟。
Compute-Optimal Inference 研究如何按任务难度动态分配推理预算:简单任务少思考,复杂任务多探索。工程实现包括:任务难度预估、动态采样次数、早停机制(验证器确认正确后停止搜索)。
与 Process Reward Model(PRM)关系密切:PRM 为推理路径的每步提供奖励信号,指导搜索方向,避免盲目采样。
与 Train-Time Scaling 的关系
Train-time scaling 通过增加参数量、数据量、算力提升模型能力(Scaling Law);Test-time scaling 在固定模型权重下,通过推理时增加计算量提升表现。
两者互补:基座模型越强,单位推理算力收益越高。推理模型(o1、DeepSeek-R1)通过 RL 学会更有效地利用推理时算力做自我探索与验证,是 test-time scaling 的内生化体现——模型自己学会何时该多想、何时该停。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「推理时多花算力换更强表现」
- 「与 train-time scaling 互补的第二扩展维度」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
- 高级概念查看详解 →
比较 Subquadratic Attention 与标准 Self-Attention 的复杂度差异。长上下文 LLM 的工程挑战有哪些?
考察候选人对注意力机制复杂度的理解:标准自注意力为何是 O(n²)、亚二次注意力的实现路径(稀疏/低秩/线性/SSM)、SubQ 的工程突破,以及长上下文 LLM 在内存、延迟、成本上的工程挑战。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Test-Time Compute Scaling」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
