智算弱电学习系统
论文库›产品设计层›ReAct: Synergizing Reasoning and Acting in Language Models
必读产品设计层2023
Yao et al.
💡 AI Agent 的思维框架——让模型边思考边行动,是当前 Agent 产品的核心设计模式

ReAct:让语言模型协同推理与行动

原标题:ReAct: Synergizing Reasoning and Acting in Language Models 作者:Shunyu Yao et al. (Princeton / Google Brain) 发表年份:2023 · ICLR 一句话价值:ReAct 让大模型学会了「先想一步,再做一步」的交替工作方式,成为了 AI Agent 产品设计的基础框架。


30 秒速览

以前让大模型帮你做事,它要么只会「想」(推理但不执行),要么只会「做」(执行但不思考为什么)。ReAct 的突破很简洁:让模型在推理和行动之间交替进行——先想一下该干什么(Thought),然后执行一个动作(Action),看到结果后再想下一步。就像一个靠谱的助理:先分析问题,执行一步,检查结果,再决定下一步。这个「想→做→观察→想→做」的循环,成了所有 AI Agent 的基本工作模式。


核心问题

大模型有两种能力各自为战:

  1. 推理能力(Chain-of-Thought):模型能分步思考,但只是在脑子里想,不会去外面查资料或执行操作
  2. 行动能力:模型能调用工具(搜索、计算器等),但只是机械执行,不会反思结果

产品需要的是:一个能思考、能行动、能根据结果调整策略的 Agent。


关键创新

1. Thought-Action-Observation 循环

是什么:

  • Thought(想):模型先分析当前情况,规划下一步
  • Action(做):执行一个具体操作(搜索、调 API、查数据库)
  • Observation(看):观察执行结果
  • 然后回到 Thought,基于结果决定下一步

为什么重要:这个循环让 AI 具备了「自主工作」的能力——不是简单地一问一答,而是能持续推进任务直到完成。

一句话记忆:「ReAct 的 Thought-Action-Observation 循环是 AI Agent 的基本呼吸节奏。」

2. 推理让行动更准确

是什么:论文实验证明,让模型在行动前先推理一下(Thought),搜索准确率和任务完成率都大幅提升。模型会自己思考"我应该搜什么关键词"、"这个结果够不够"、"需不需要进一步查"。

为什么重要:这意味着 Agent 产品的质量不只取决于工具有多好,还取决于推理策略设计得好不好。

一句话记忆:「加一个 Thought 步骤,Agent 的准确率能提升 20% 以上——思考比盲目行动更重要。」

3. 行动让推理更可靠

是什么:纯推理(CoT)容易产生幻觉——模型编造事实来支撑推理。ReAct 的行动步骤让模型能获取真实信息,大幅减少了幻觉。

为什么重要:对产品来说,这意味着 Agent 架构天然比纯对话架构更准确——因为 Agent 可以用工具验证自己的推理。


产品经理视角

这篇论文改变了什么?

  • 之前:AI 只能做一问一答式的对话,无法自主完成复杂任务
  • 之后:AI 可以像人类一样「分析→执行→反思→继续」,自主完成多步骤任务
  • 产品影响:直接催生了 Claude Computer Use、Auto-GPT、ChatGPT Plugins 等 Agent 产品形态

你应该知道的数据

  • ReAct 在 HotpotQA(多跳问答)上比纯 CoT 准确率提升了 6%
  • 在 ALFWorld(虚拟环境任务)上,ReAct 的任务完成率比纯行动模型提升了 34%
  • ReAct 的幻觉率比纯 CoT 降低了约 30%

实际应用场景

  1. Claude Agent / Computer Use:Anthropic 的 AI Agent 基于类似思路,能自主操作电脑完成任务
  2. Auto-GPT / AgentGPT:自主 Agent 项目的底层范式就是 ReAct 循环
  3. LangChain Agent:最流行的 Agent 开发框架,核心就是 ReAct 模式的实现

面试高频问题

Q1: 什么是 ReAct?它和 Chain-of-Thought 有什么区别?

参考回答:ReAct 是让大模型交替进行推理(Thought)和行动(Action)的框架。与 Chain-of-Thought 的区别在于:CoT 只是让模型在脑子里分步思考,但不与外部世界交互;ReAct 不仅思考,还能执行操作(搜索、调 API、查数据库),然后基于真实结果继续推理。打个比方,CoT 像是闭卷考试——模型只能用脑子里的知识;ReAct 像是开卷考试——模型可以查资料、验证答案。所以 ReAct 的准确率更高、幻觉更少。

Q2: AI Agent 的核心架构是什么?

参考回答:AI Agent 的核心是 ReAct 提出的 Thought-Action-Observation 循环。Agent 接到任务后,先分析任务(Thought),决定调用什么工具(Action),查看执行结果(Observation),然后决定下一步。这个循环持续进行直到任务完成。在工程实现上,还需要考虑工具注册、错误处理、最大循环次数限制、上下文管理等实际问题。

Q3: 设计一个 AI Agent 产品需要注意什么?

参考回答:三个关键设计点:第一是工具选择——给 Agent 接入哪些工具决定了它能做什么,要精选而非贪多;第二是失败处理——Agent 在执行中可能遇到工具调用失败、结果不符预期等情况,需要设计重试策略和兜底方案;第三是可控性——用户需要能看到 Agent 的推理过程(透明度)、能在关键节点确认(审批机制)、能随时中止(终止开关)。不能让 Agent 变成一个黑盒。


与其他论文的关系

  • 前置知识:Chain-of-Thought Prompting(推理基础),Toolformer(工具使用)
  • 后续发展:
    • Reflexion(2023):让 Agent 从失败中学习和反思
    • AutoGPT(2023):全自主 Agent 的实际项目
    • Claude Computer Use(2024):Anthropic 的桌面操作 Agent
  • 对比论文:与 Toolformer 相比,ReAct 强调推理与行动的协同,而 Toolformer 侧重工具调用能力本身

一页纸总结

维度内容
核心贡献提出 Thought-Action-Observation 交替循环框架,统一了推理和行动
关键概念ReAct、Thought-Action-Observation Loop、Agent Architecture
PM 必记ReAct 循环是 AI Agent 产品的基本设计模式,所有 Agent 框架都基于此
面试金句「ReAct 的核心洞察是:思考让行动更精准,行动让思考更靠谱——Agent 的能力来自两者的协同,而不是某一个单独的突破。」
局限性多步循环增加延迟和成本;推理步骤的质量取决于模型能力;缺乏长期记忆和规划能力