收藏 | CoT、ReAct、ToT 推理模式深度解析:小白也能看懂的大模型选型指南
本文深入解析了 CoT、ReAct、ToT 三种大模型推理模式的原理与适用场景,强调它们并非简单的升级关系。通过对比分析,指出 ReAct 适用于大多数 Agent 任务,而 ToT 的成本显著高于 ReAct,效果提升有限。文章建议根据任务推理步数和路径唯一性选择合适的模式,并提供决策路径图辅助读者选型,适合有一定 ChatGPT 使用经验的工程师学习。
很多人把 CoT、ReAct、ToT 当成"初级→高级"的升级关系,好像 ToT 一定比 CoT 好。但实际测试下来,80% 的 Agent 任务用 ReAct 就够了,ToT 的成本是 ReAct 的 5-10 倍,效果提升可能只有几个百分点。
阅读提示
- 适合谁看:用过 ChatGPT / 知道 Function Calling,但还没系统研究过推理模式的工程师
- 看完能做什么:理解 CoT/ReAct/ToT 的原理差异、选对推理模式、避免过度设计
- 不适合谁:还没用过大模型做推理任务的读者
先给结论
- CoT、ReAct、ToT 不是三种"升级版",而是三种完全不同的推理范式——适用场景、成本、可靠性差异巨大
- 大多数 Agent 项目只需要 ReAct 就够了——ToT 的复杂度和成本是 ReAct 的 5-10 倍,只有在需要"探索多条路径"的场景才值得
- 推理模式的选择核心是"你的任务需要多少步推理"和"推理路径是否唯一"——单步任务不需要 CoT,路径唯一的任务不需要 ToT
01 三种模式不是升级关系
先纠正一个常见误区:CoT → ReAct → ToT 不是"初级→高级"的升级路径。
CoT(Chain-of-Thought):纯推理链。让模型"一步一步想",但不和外部世界交互。适合推理路径清晰、不需要外部信息的任务。
ReAct(Reasoning + Acting):推理+执行交替。每一步先想(Thought),再做(Action),再看结果(Observation),循环往复。适合需要外部信息、推理路径唯一的任务。
ToT(Tree-of-Thought):树状探索。每步生成多个候选,评估后保留最优的几个,继续往下探索。适合推理路径不唯
一、需要"尝试多条路"的任务。

图 1|三种推理模式的执行流程对比
核心区别不是"谁更聪明",而是"谁更适合"。
02 CoT 的原理:为什么"一步一步想"能提升推理能力
CoT 的核心思想是让模型在生成最终答案之前,先生成中间推理步骤。
从 Attention 的角度看,为什么这有效:
当模型直接回答"17 × 24 = ?“时,它要在一步 Attention 里完成整个乘法——这对模型来说很难。但如果让它先算"17 × 20 = 340”、“17 × 4 = 68”、“340 + 68 = 408”,每一步的中间结果都作为 token 进入 KV Cache,为后续步骤提供了推理上下文。
CoT 的 Prompt 模板:
请一步一步思考以下问题:
问题:一个商店有 17 个苹果,卖掉了 24% 后又进货了 10 个,现在有多少个?
让我们一步一步来:
1. **先算卖掉的数量:17 × 24% = 17 × 0.24 = 4.08,约 4 个**
2. **剩余数量:17 - 4 = 13 个**
3. **进货后:13 + 10 = 23 个**
答案:23 个
CoT 的局限:纯推理,不能调用外部工具。如果问题需要查数据库、调 API、执行代码,CoT 就无能为力了。
03 ReAct 的原理:推理+执行交替
ReAct 的核心思想是在推理过程中穿插外部工具调用,每一步都是 Thought → Action → Observation 循环。
ReAct 的 Prompt 模板:
你是一个能使用工具的助手。请按以下格式回答问题:
Thought: 我需要思考什么
Action: 调用哪个工具,传什么参数
Observation: 工具返回的结果
... (重复 Thought/Action/Observation)
Thought: 我已经有足够信息了
Final Answer: 最终答案
可用工具:
- search(query): 搜索互联网
- calculator(expression): 计算数学表达式
- sql_query(sql): 执行 SQL 查询
问题:小米集团上周五的收盘价是多少?涨跌幅是多少?
ReAct 的执行过程:
Thought: 我需要查小米集团上周五的收盘价,然后计算涨跌幅
Action: search("小米集团 上周五 收盘价")
Observation: 小米集团(1810.HK)上周五收盘价 42.50 港元
Thought: 我拿到了收盘价,现在需要查前一天的收盘价来算涨跌幅
Action: search("小米集团 上周四 收盘价")
Observation: 小米集团(1810.HK)上周四收盘价 41.80 港元
Thought: 涨跌幅 = (42.50 - 41.80) / 41.80 = 1.67%
Final Answer: 小米集团上周五收盘价 42.50 港元,涨跌幅 +1.67%
ReAct 和 CoT 的本质区别:CoT 是纯推理(只在脑子里想),ReAct 是推理+执行(想了就去做,做完再想)。ReAct 的每一步 Action 都会调用真实的外部工具,拿到真实数据。
04 ToT 的原理:把推理建模为树搜索
ToT 的核心思想是在每一步生成多个候选,评估后保留最优的几个,继续往下探索——本质上是把推理过程建模为树搜索(BFS/DFS)。
ToT 的 Prompt 模板:
你是一个需要探索多条路径的问题求解器。
每一步请生成 3 个候选思路,评估每个思路的可行性(1-10 分),保留得分最高的 1-2 个继续探索。
问题:设计一个方案,让用户在 3 秒内找到想要的商品
Step 1 - 候选思路:
A. 全文搜索(可行性 6/10):简单但结果不精准
B. 分类导航+筛选(可行性 8/10):结构化但需要用户多步操作
C. AI 对话式推荐(可行性 9/10):最自然但需要理解用户意图
保留 B 和 C 继续探索。
Step 2 - 深入 B(分类导航+筛选):
B1. 三级分类+多维度筛选(可行性 7/10)
B2. 智能分类+一键筛选(可行性 8/10)← 推荐
Step 2 - 深入 C(AI 对话式推荐):
C1. 纯文本对话(可行性 6/10)
C2. 多模态对话+图片识别(可行性 9/10)← 推荐
最终方案:C2(多模态对话+图片识别),备选 B2
ToT 和 ReAct 的本质区别:ReAct 是单条路径探索(走一步看一步),ToT 是多条路径并行探索(同时走多条路,选最好的)。ToT 的 LLM 调用次数是 ReAct 的 3-5 倍,但能找到更优解。
05 三种模式对比
| 维度 | CoT | ReAct | ToT |
|---|---|---|---|
| 推理方式 | 线性链式 | 推理+执行交替 | 树状多路径探索 |
| LLM 调用次数 | 1 次 | 3-6 次 | 5-15 次 |
| token 消耗 | 低 | 中高 | 高 |
| 外部工具调用 | 不支持 | 支持 | 支持(更复杂) |
| 适用任务 | 数学推理、逻辑推导 | 信息检索、代码执行 | 创意写作、策略规划 |
| 可靠性 | 高(路径确定) | 中高(依赖工具) | 中(路径不确定) |
| 最佳场景 | 推理路径清晰、不需要外部信息 | 需要外部信息、路径唯一 | 需要探索多条路径、路径不唯一 |
06 最小实验:同一题三种模式求解
问题:“小明有 100 元,买了 3 本单价 25 元的书,又用剩下的钱的 60% 买了文具,最后还剩多少钱?”
CoT 求解(1 次 LLM 调用):
1. **买书花费:3 × 25 = 75 元**
2. **剩余:100 - 75 = 25 元**
3. **文具花费:25 × 60% = 15 元**
4. **最终剩余:25 - 15 = 10 元**
答案:10 元
ReAct 求解(3 次 LLM 调用):
Thought: 先算买书花了多少
Action: calculator("3 * 25")
Observation: 75
Thought: 再算剩余
Action: calculator("100 - 75")
Observation: 25
Thought: 最后算文具花费和剩余
Action: calculator("25 * 0.6")
Observation: 15
Final Answer: 剩余 10 元
ToT 求解(5+ 次 LLM 调用):
候选 1: 先算总花费再减(不可行,不知道文具具体价格)
候选 2: 分步算,先算书,再算文具(可行,8 分)← 保留
候选 3: 用方程解(可行但复杂,6 分)
...继续探索候选 2...
观察:这个问题只有一个正确解法,CoT 就够了。ReAct 多调了 2 次 LLM(为了用计算器),ToT 多调了 4 次 LLM(为了探索多条路径),但结果一样。这就是"过度推理"——ToT 在简单任务上反而更慢且不更好。
07 "看起来强其实弱"的反例
反例 1:ToT 在简单检索任务上反而更差
一个信息检索任务:“查一下北京今天的天气”。
- ReAct:search(“北京今天天气”) → 拿到结果 → 回答。1 次工具调用,成功率 95%
- ToT:生成 3 个搜索候选 → 评估 → 选最优 → 搜索 → 评估结果 → 可能再搜一轮。3-5 次工具调用,成功率 88%(因为多轮搜索反而引入了噪音)
反例 2:CoT 在需要外部信息的任务上完全失效
“小米集团上周五的收盘价是多少?”
- CoT:模型不知道最新股价,只能瞎猜或说"我没有实时数据"
- ReAct:search(“小米集团 上周五 收盘价”) → 拿到真实数据 → 回答
在我们的项目里,ReAct 在信息检索类任务上的成功率约 85%,ToT 在同类任务上约 88%,但成本高了 6 倍——这个 trade-off 在大多数场景下不划算。
08 选型决策路径

图 2|推理模式选型决策图
简单决策规则:
-
单步推理、不需要外部信息 → 直接 Prompt,不需要 CoT
-
多步推理、路径唯
一、需要外部信息 → ReAct(推荐,80% 的 Agent 任务属于这类)
- 多步推理、路径唯
一、不需要外部信息 → CoT
- 多步推理、多条路径、需要探索 → ToT(成本高,慎用)
什么时候三种模式都不够:
当任务需要复杂的工具编排(多个工具串联/并联)、长期记忆管理、多 Agent 协作时,单靠推理模式不够,需要用 Agent 框架(LangChain / LangGraph / AutoGen)来编排。
09 给读者一个能用来做决策的结论
决策帮助
- 如果你不确定用什么:先用 ReAct——它是大多数 Agent 任务的默认选择
- 如果你的任务纯推理、不需要工具:用 CoT,成本最低
- 如果你的任务需要探索多条路径(创意、策略、博弈):试 ToT,但要做好成本预期
- 如果你只能先做一步:用 ReAct 跑通一个完整的 Thought → Action → Observation 循环——这一步能帮你建立"Agent 推理"的直觉
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


为什么要学习大模型?
我国在A大模型领域面临人才短缺,数量与质量均落后于发达国家。2023年,人才缺口已超百万,凸显培养不足。随着AI技术飞速发展,预计到2025年,这一缺口将急剧扩大至400万,严重制约我国AI产业的创新步伐。加强人才培养,优化教育体系,国际合作并进是破解困局、推动AI发展的关键。


大模型入门到实战全套学习大礼包
1、大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!

2、大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。

3、AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

4、大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。

5、大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

适用人群

第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐


所有评论(0)