ReAct:让语言模型协同推理与行动
原标题:ReAct: Synergizing Reasoning and Acting in Language Models 作者:Shunyu Yao et al. (Princeton / Google Brain) 发表年份:2023 · ICLR 一句话价值:ReAct 让大模型学会了「先想一步,再做一步」的交替工作方式,成为了 AI Agent 产品设计的基础框架。
30 秒速览
以前让大模型帮你做事,它要么只会「想」(推理但不执行),要么只会「做」(执行但不思考为什么)。ReAct 的突破很简洁:让模型在推理和行动之间交替进行——先想一下该干什么(Thought),然后执行一个动作(Action),看到结果后再想下一步。就像一个靠谱的助理:先分析问题,执行一步,检查结果,再决定下一步。这个「想→做→观察→想→做」的循环,成了所有 AI Agent 的基本工作模式。
核心问题
大模型有两种能力各自为战:
- 推理能力(Chain-of-Thought):模型能分步思考,但只是在脑子里想,不会去外面查资料或执行操作
- 行动能力:模型能调用工具(搜索、计算器等),但只是机械执行,不会反思结果
产品需要的是:一个能思考、能行动、能根据结果调整策略的 Agent。
关键创新
1. Thought-Action-Observation 循环
是什么:
- Thought(想):模型先分析当前情况,规划下一步
- Action(做):执行一个具体操作(搜索、调 API、查数据库)
- Observation(看):观察执行结果
- 然后回到 Thought,基于结果决定下一步
为什么重要:这个循环让 AI 具备了「自主工作」的能力——不是简单地一问一答,而是能持续推进任务直到完成。
一句话记忆:「ReAct 的 Thought-Action-Observation 循环是 AI Agent 的基本呼吸节奏。」
2. 推理让行动更准确
是什么:论文实验证明,让模型在行动前先推理一下(Thought),搜索准确率和任务完成率都大幅提升。模型会自己思考"我应该搜什么关键词"、"这个结果够不够"、"需不需要进一步查"。
为什么重要:这意味着 Agent 产品的质量不只取决于工具有多好,还取决于推理策略设计得好不好。
一句话记忆:「加一个 Thought 步骤,Agent 的准确率能提升 20% 以上——思考比盲目行动更重要。」
3. 行动让推理更可靠
是什么:纯推理(CoT)容易产生幻觉——模型编造事实来支撑推理。ReAct 的行动步骤让模型能获取真实信息,大幅减少了幻觉。
为什么重要:对产品来说,这意味着 Agent 架构天然比纯对话架构更准确——因为 Agent 可以用工具验证自己的推理。
产品经理视角
这篇论文改变了什么?
- 之前:AI 只能做一问一答式的对话,无法自主完成复杂任务
- 之后:AI 可以像人类一样「分析→执行→反思→继续」,自主完成多步骤任务
- 产品影响:直接催生了 Claude Computer Use、Auto-GPT、ChatGPT Plugins 等 Agent 产品形态
你应该知道的数据
- ReAct 在 HotpotQA(多跳问答)上比纯 CoT 准确率提升了 6%
- 在 ALFWorld(虚拟环境任务)上,ReAct 的任务完成率比纯行动模型提升了 34%
- ReAct 的幻觉率比纯 CoT 降低了约 30%
实际应用场景
- Claude Agent / Computer Use:Anthropic 的 AI Agent 基于类似思路,能自主操作电脑完成任务
- Auto-GPT / AgentGPT:自主 Agent 项目的底层范式就是 ReAct 循环
- LangChain Agent:最流行的 Agent 开发框架,核心就是 ReAct 模式的实现
面试高频问题
Q1: 什么是 ReAct?它和 Chain-of-Thought 有什么区别?
参考回答:ReAct 是让大模型交替进行推理(Thought)和行动(Action)的框架。与 Chain-of-Thought 的区别在于:CoT 只是让模型在脑子里分步思考,但不与外部世界交互;ReAct 不仅思考,还能执行操作(搜索、调 API、查数据库),然后基于真实结果继续推理。打个比方,CoT 像是闭卷考试——模型只能用脑子里的知识;ReAct 像是开卷考试——模型可以查资料、验证答案。所以 ReAct 的准确率更高、幻觉更少。
Q2: AI Agent 的核心架构是什么?
参考回答:AI Agent 的核心是 ReAct 提出的 Thought-Action-Observation 循环。Agent 接到任务后,先分析任务(Thought),决定调用什么工具(Action),查看执行结果(Observation),然后决定下一步。这个循环持续进行直到任务完成。在工程实现上,还需要考虑工具注册、错误处理、最大循环次数限制、上下文管理等实际问题。
Q3: 设计一个 AI Agent 产品需要注意什么?
参考回答:三个关键设计点:第一是工具选择——给 Agent 接入哪些工具决定了它能做什么,要精选而非贪多;第二是失败处理——Agent 在执行中可能遇到工具调用失败、结果不符预期等情况,需要设计重试策略和兜底方案;第三是可控性——用户需要能看到 Agent 的推理过程(透明度)、能在关键节点确认(审批机制)、能随时中止(终止开关)。不能让 Agent 变成一个黑盒。
与其他论文的关系
- 前置知识:Chain-of-Thought Prompting(推理基础),Toolformer(工具使用)
- 后续发展:
- Reflexion(2023):让 Agent 从失败中学习和反思
- AutoGPT(2023):全自主 Agent 的实际项目
- Claude Computer Use(2024):Anthropic 的桌面操作 Agent
- 对比论文:与 Toolformer 相比,ReAct 强调推理与行动的协同,而 Toolformer 侧重工具调用能力本身
一页纸总结
| 维度 | 内容 |
|---|---|
| 核心贡献 | 提出 Thought-Action-Observation 交替循环框架,统一了推理和行动 |
| 关键概念 | ReAct、Thought-Action-Observation Loop、Agent Architecture |
| PM 必记 | ReAct 循环是 AI Agent 产品的基本设计模式,所有 Agent 框架都基于此 |
| 面试金句 | 「ReAct 的核心洞察是:思考让行动更精准,行动让思考更靠谱——Agent 的能力来自两者的协同,而不是某一个单独的突破。」 |
| 局限性 | 多步循环增加延迟和成本;推理步骤的质量取决于模型能力;缺乏长期记忆和规划能力 |