Tree of Thoughts(思维树)
Tree of Thoughts把推理展开成树搜索
亦作、亦称:思维树 · ToT
思维树(Tree of Thoughts,ToT)是对链式思维(CoT)的结构性扩展,将大语言模型的推理过程建模为树状搜索,允许在中间步骤上分叉、评估与回溯,从而在需要规划与多步探索的复杂任务中显著提升表现。
概述
思维树(Tree of Thoughts,ToT)是对链式思维(CoT)的结构性扩展,将大语言模型的推理过程建模为树状搜索,允许在中间步骤上分叉、评估与回溯,从而在需要规划与多步探索的复杂任务中显著提升表现。
核心思想
ToT 把语言模型的推理视为在「思维空间」中的搜索问题,而非单一的线性生成过程。
- 思维节点(Thought):每个中间推理步骤被视为树上的一个节点,可以是一句话、一段推断或一个计划步骤
- 分支生成:模型在每个节点处生成多个候选子步骤,形成分叉探索
- 自我评估:模型对每个候选节点打分或投票,判断其是否值得继续扩展
- 搜索策略:支持广度优先搜索(BFS)与深度优先搜索(DFS),并可结合剪枝与回溯
工作原理
ToT 框架由三个核心组件协同驱动。
- 思维生成器(Thought Generator):在每个节点处采样若干候选推理步骤,可通过独立采样或逐步提示(propose prompting)实现
- 状态评估器(State Evaluator):对候选节点打分,通常调用语言模型让其自我判断当前思路是否有希望,也可接入外部验证器(如代码执行器)
- 搜索算法:BFS 按层展开保证解的完整性;DFS 沿最优路径深入并在死路时回溯,节省内存
- 终止条件:到达目标状态(答案满足验证标准)或搜索预算耗尽(节点数或 API 调用次数上限)
实验结果
论文在三类需要规划与搜索的任务上验证了 ToT 的优越性。
- 24 点游戏(Game of 24):GPT-4 配合 CoT 仅解决约 4% 的题目,ToT 达到 74% 的成功率,提升幅度最为显著
- 创意写作:ToT 在人类评估中获得更高的连贯性与创意得分
- 迷你填字:ToT 显著优于单路径推理方法,展现出对约束满足问题的适应能力
- 结论:收益主要体现在中间状态可被明确评估的任务,对简单单步问答提升有限
与相邻概念的区别
- ToT vs CoT:CoT 沿单一路径线性生成,无分支无回溯;ToT 引入宽度(多候选)与深度回溯,本质上是对推理过程进行搜索
- ToT vs Self-Consistency:Self-Consistency 在最终答案层多次采样投票;ToT 在中间状态层评估,能更早剪掉无效路径
- ToT vs ReAct:ReAct 将推理与工具调用交替进行,但仍是单条线性链,没有分支回溯机制
- ToT vs Test-Time Compute:测试时计算是更宽泛的概念,ToT 是其中一种基于树搜索的早期具体实现
扩展与变体
原始 ToT 发表后,多个工作在其基础上做了结构或搜索策略的扩展。
- Graph of Thoughts(GoT,2023):将树推广为有向图,允许不同分支的中间结果合并,表达能力更强
- Reasoning via Planning(RAP,2023): 用蒙特卡洛树搜索(MCTS) 驱动推理,以价值函数替代模型自评打分
-外部验证器变体 :用数学符号系统或单元测试作为评估信号,规避模型自评偏差
- 推理模型内化: OpenAI o1、DeepSeek-R1 等通过强化学习将搜索与回溯能力内化到模型训练层,是 ToT 思想的深度延伸
局限与误区
- 计算成本高:每步需多次 LLM 调用(生成+评估),API 费用与延迟远高于普通 CoT,不适合延迟敏感的生产场景
- 评估器质量是瓶颈:若模型自评不可靠,搜索反而会在错误方向上持续扩展
- 超参数敏感:每层候选数、搜索深度、剪枝阈值对结果影响显著,缺乏通用配置
- 结构依赖性强:任务须有明确的中间状态边界,否则树节点的划分本身难以定义
- 常见误区:ToT 不等于「多次 CoT 投票」,其价值在于中间状态的回溯,而非仅对最终答案做集成
发展脉络
- 2022:Wei 等人提出 链式思维(Chain-of-Thought)提示,证明中间步骤能提升推理能力
- 2022: Wang 等人提出自我一致性(Self-Consistency) ,通过多路径采样投票提升 CoT 准确率
-2023 年 5 月 :Shunyu Yao、Dian Yu 等人(普林斯顿大学与 Google DeepMind)发布 ToT 论文预印本(arXiv:2305.10601)
- 2023 年 12 月: 论文正式收录于 NeurIPS 2023,七位作者分别来自普林斯顿与 Google
-2023 年下半年:Graph of Thoughts(GoT)、RAP 等变体相继发表,结构推理进入快速迭代期
- 2024 年: OpenAI o1、DeepSeek-R1 等推理模型内化了类似搜索与回溯能力,ToT 思想从提示工程层下沉到训练层
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「把推理展开成树搜索」
- 「比 CoT 更会分支回溯」
- 「复杂规划常用」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
思维树(Tree of Thoughts)如何扩展思维链 CoT?
把推理建模为可分支的思维状态树,对每步生成多个候选并评估,配合搜索与回溯探索解空间。
- 中级系统设计查看详解 →
如何为 AI Agent 交易设计审计和权限控制?
考察候选人对 Agent 经济活动的审计和权限控制设计,特别是 Smart Tokens 等可编程支付工具的应用。
- 高级系统设计查看详解 →
Multi-Agent 系统中如何处理 Agent 遗忘/状态丢失?
考察候选人对 Multi-Agent 系统中状态管理和容错设计的理解,特别是 Agent 崩溃、重启或上下文丢失时的恢复策略。
- 高级系统设计查看详解 →
设计一个 Agent 长期记忆系统,支持可写外部记忆、过期策略和冲突解决
考察候选人对 Agent 记忆架构的理解,特别是从 RAG 只读到可写外部记忆的演进,以及过期、冲突解决等工程挑战。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
