智算弱电学习系统
论文库›产品设计层›Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
必读产品设计层2022
Wei et al.
💡 一句'请分步思考'就能让模型推理能力暴涨——Prompt Engineering 的奠基之作

思维链提示激发大模型推理能力

原标题:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 作者:Jason Wei et al. (Google Brain) 发表年份:2022 · NeurIPS 一句话价值:发现了一个极其简单但极其有效的方法——让模型在回答之前先「分步思考」,数学和推理任务的准确率大幅提升。


30 秒速览

以前让大模型做数学题或逻辑推理,直接问答的准确率很低。这篇论文发现了一个惊人的现象:只要在提示词里加上「让我们一步一步想」或者给一个分步推理的示例,模型的推理能力就会大幅提升。这就像一个学生,直接回答数学题经常出错,但如果你说"把过程写出来",正确率突然变高了。这个发现不仅奠定了 Prompt Engineering 的理论基础,也直接影响了所有 AI 产品的提示词设计策略。


核心问题

大模型在复杂推理任务上表现差——数学题、逻辑推理、多步骤问题的直接回答准确率很低。原因是模型倾向于「跳步」——直接给出最终答案而不展示推理过程,就像一个考试不写步骤的学生。


关键创新

1. Chain-of-Thought(思维链)

是什么:在提示词的示例中,不只给出最终答案,还展示推理的中间步骤。模型看到这些示例后,也会在回答时展示推理过程,从而大幅提升准确率。

为什么重要:这个发现意味着模型其实「会」推理,只是之前没被正确引导。对产品来说,这意味着 Prompt 的设计方式直接决定了 AI 功能的质量。

一句话记忆:「思维链的本质是:不要让 AI 跳步——写出过程的 AI 和写出过程的学生一样,答案更可靠。」

2. Zero-Shot CoT(零样本思维链)

是什么:后续研究发现,甚至不需要给示例,只需要在提示词末尾加上一句"Let's think step by step"(让我们分步思考),就能激活思维链效果。

为什么重要:这是最低成本的 AI 产品质量提升手段——改一句提示词就能显著提升推理类任务的表现。

一句话记忆:「一句'请分步思考'就是免费的推理加速器。」

3. 规模依赖性

是什么:论文发现思维链只在足够大的模型(约 100B+ 参数)上有效。小模型即使加了 CoT 提示也几乎没有提升。

为什么重要:这告诉产品经理:不是所有模型都适合用 CoT 策略。选型时需要考虑模型规模是否能支撑你的推理需求。


产品经理视角

这篇论文改变了什么?

  • 之前:大模型在推理任务上表现不佳,产品经理认为 AI 不适合做需要推理的功能
  • 之后:通过正确的 Prompt 设计,AI 的推理能力可以大幅释放
  • 产品影响:所有 AI 产品的系统提示词中几乎都会融入 CoT 思想;OpenAI 的 o1 模型更是将 CoT 内化到了模型训练中

你应该知道的数据

  • GSM8K(小学数学题)上:标准 Prompt 准确率 17.9%,CoT Prompt 提升到 58%
  • 在多步推理基准上平均提升 15-30%
  • 一句"Let's think step by step"就能在 Zero-Shot 场景下平均提升准确率 10-15%

实际应用场景

  1. OpenAI o1/o3:将 CoT 从 Prompt 技巧内化为模型训练策略,模型自动进行深度推理
  2. Claude 的系统提示词:Anthropic 的官方指南推荐在复杂任务中使用 CoT
  3. 所有 AI 编码工具:Copilot、Cursor 等工具在处理复杂编程问题时都会内部使用 CoT

面试高频问题

Q1: 什么是 Chain-of-Thought?它在产品中怎么应用?

参考回答:Chain-of-Thought 是一种提示词技术,通过引导大模型展示推理的中间步骤来提升复杂任务的准确率。在产品中的应用很广泛:比如在系统提示词中加入"请分析原因后再给出结论"这样的引导;在复杂功能(如数据分析、代码审查)的 Prompt 中设计明确的推理框架;甚至在用户界面上展示 AI 的推理过程以增加信任感。OpenAI 的 o1 模型更是把 CoT 做成了模型级别的能力。

Q2: 什么情况下应该使用 CoT,什么情况下不需要?

参考回答:需要用 CoT 的场景:多步推理(数学计算、逻辑分析)、复杂决策(方案比较、利弊分析)、需要解释过程的任务。不需要的场景:简单的信息检索、翻译、文本改写等不需要复杂推理的任务。用 CoT 的代价是增加了输出 token 数量(成本上升)和响应延迟,所以要在质量和效率间做权衡。

Q3: Prompt Engineering 的核心原则是什么?

参考回答:CoT 论文揭示了 Prompt Engineering 的核心原则:模型的表现很大程度上取决于你怎么问。三个关键原则:第一是明确性——告诉模型你想要什么格式和深度的回答;第二是结构化——用步骤、框架来引导模型的推理路径;第三是示例驱动——给模型看你期望的输出样例。这些原则对 AI 产品设计的启示是:好的 Prompt 设计本质上就是好的产品设计。


与其他论文的关系

  • 前置知识:GPT-3 Few-Shot Learning
  • 后续发展:
    • Self-Consistency(2023):多次推理取最一致的答案,进一步提升 CoT 效果
    • Tree-of-Thought(2023):让模型探索多条推理路径,选最优解
    • OpenAI o1(2024):将 CoT 内化到模型训练中,实现原生推理能力
  • 对比论文:与 ReAct 相比,CoT 只做推理不做行动;ReAct 将 CoT 的推理与工具调用结合

一页纸总结

维度内容
核心贡献发现通过提示词引导模型分步推理可以大幅提升复杂任务准确率
关键概念Chain-of-Thought、Zero-Shot CoT、Emergent Abilities、Prompt Engineering
PM 必记CoT 是成本最低的 AI 质量提升手段——好的 Prompt 设计就是好的产品设计
面试金句「CoT 证明了一个深刻的观点:AI 的能力边界不只取决于模型大小,还取决于你怎么跟它沟通——这就是为什么 Prompt Engineering 本质上是产品设计。」
局限性只在大模型上有效(100B+ 参数);增加输出 token 导致成本上升;推理过程可能产生错误的「自信」