智算弱电学习系统
论文库›基础认知层›Recursive Models for Long-Horizon Reasoning
必读基础认知层2026
Chenxiao Yang et al.
💡 两个 token 让 AI 学会递归调用自己,把计算能力从 PSPACE 跳到 EXPTIME,3B 模型击败 GPT-4o

递归模型:让 AI 学会"调用自己"

原标题:Recursive Models for Long-Horizon Reasoning 作者:Chenxiao Yang, Nathan Srebro, Zhiyuan Li 发表年份:2026 · arXiv (cs.LG, cs.CL) 一句话价值:这篇论文从理论上证明了为什么现在所有 AI Agent 框架都有上限——以及如何突破


30 秒速览

你有没有想过,为什么给 AI 更长的上下文窗口,它也不一定变"聪明"?这篇论文告诉你:真正的瓶颈不是窗口长度,是推理结构。

作者的解法极其简单:给语言模型加两个特殊 token,<call> 和 <return>,让模型像写程序一样"调用自己"解决子问题。理论证明,这个微小改动把 AI 的计算能力从一个理论上限跳到了更高一级——而且用 30 亿参数的小模型就击败了 GPT-4o。


核心问题

AI 的长程推理为什么难? 不是因为模型不够聪明,而是因为所有推理都被压在一条线性 token 序列里。你告诉它"想清楚再回答"(Chain-of-Thought),它只是把思考过程写在纸上;你让它"先搜索再总结"(ReAct),本质还是线性展开。这些方法在理论上都被一个叫 PSPACE 的计算能力天花板卡死了。

真正的长程问题(比如解 SAT 谜题、写复杂代码、做多步规划)需要的是递归:把大问题拆成小问题,每个小问题独立解决,结果再拼回来。人类程序员写代码时天然这样做,但现在所有 LLM 都不会。


关键创新

1. 两个 Token 改变计算等级

是什么:在词表里加两个特殊符号 <call> 和 <return>。模型学会遇到复杂子问题时发出 <call>(开启新的独立上下文窗口处理子问题),子问题解决后 <return> 把结果带回来,就像程序调用函数一样。

为什么重要:这不是工程 trick,是理论突破。论文严格证明:使用这两个原语的递归模型,计算能力从 PSPACE 提升到 EXPTIME——这是一个指数级的鸿沟。上下文窗口可以保持有界(不需要更长的窗口),但能解决的问题复杂度随递归深度指数增长。

一句话记忆:两个 token,一个量级跨越。

2. ReAct/CoT = 高级版摘要,本质没变

是什么:论文用形式化方法证明,所有"常数深度递归"(包括 CoT、ReAct、摘要压缩)在计算能力上等价于摘要化(Summarization)。换句话说,现有的 Agent 框架在理论上都没有突破 PSPACE 天花板,只是在天花板下面的不同位置。

为什么重要:这是对整个 Agent 框架领域的理论批评。如果你的产品用了 ReAct 或任何链式推理框架,你需要知道它们在理论上共享同一个计算上限。

一句话记忆:ReAct 再聪明,也只是更贵的摘要。

3. 最小设计即最优设计

是什么:训练时只在"当前活跃的函数栈帧"上计算损失,不需要把整个递归树展开。用合成生成的递归 traces 就能让 3B 小模型学会任意深度的递归推理。

为什么重要:实践门槛极低。不需要修改模型架构,不需要海量真实递归数据,两个特殊 token + 合成数据 + 栈帧级训练 = 理论最优的 Agent 能力。

一句话记忆:最小改动,达到理论上限。


产品经理视角

这篇论文改变了什么?

  • 之前:AI Agent 框架的竞争是"谁的 Chain-of-Thought 设计得更好",本质是在 PSPACE 内卷
  • 之后:真正的突破在架构层面——允许递归自调用才能跨越计算等级
  • 产品影响:长程任务(代码生成、复杂规划、多步骨架)的下一代方案不是"更长上下文",而是"递归 Agent 架构"

你应该知道的数据

  • 3B 参数递归模型在 Boolean SAT(NP完全问题)上显著超越 GPT-4o(700亿+ 参数)
  • 递归模型的活跃上下文始终有界,但能探索的解空间随深度指数增长
  • 理论证明:常数深度递归 ≡ 摘要化(两者计算能力等价)

实际应用场景

  1. 复杂代码生成:把"写一个完整系统"递归拆解为"写模块A"→"写模块B"→"整合",每个子任务独立完成
  2. 多步规划 Agent:旅行规划、项目管理等需要层级分解的场景,递归模型天然适配
  3. 数学/逻辑推理:证明题、SAT、组合优化等需要搜索树展开的问题

面试高频问题

Q1: 为什么现有的 Chain-of-Thought 不能解决长程推理?

参考回答:CoT 和 ReAct 都是线性序列,本质是把推理过程写进同一个上下文窗口。论文证明这类方法的计算能力上限是 PSPACE,理论上等价于"带摘要的序列处理"。真正的长程推理需要递归——把子问题外包给独立的上下文栈帧,结果再组合——这样能力才能达到 EXPTIME 量级。

Q2: 递归模型和 ReAct Agent 的本质区别是什么?

参考回答:ReAct 是线性的——把"思考+行动"写成一条序列,所有上下文在同一个窗口里累积。递归模型是树状的——遇到子问题时开启独立窗口,子问题解决后只把结果带回来,父问题的上下文始终保持干净。区别在于:ReAct 是更聪明的摘要,递归模型是真正的结构化分解。

Q3: 这个理论突破对 AI 产品有什么实际意义?

参考回答:短期内,意味着小模型通过递归架构可以在复杂任务上超越大模型——成本优势巨大。长期看,下一代 Agent 框架的竞争将从"Prompt 工程"转向"递归调用设计",类似从汇编语言时代进化到有函数调用的时代。


论文架构图解

加载图表中...

与其他论文的关系

  • 前置知识:理解 Chain-of-Thought、ReAct 的基本工作原理;了解计算复杂性基础(P/NP/PSPACE 概念)
  • 后续发展:这个框架理论上可以与任何 RLHF/强化学习方法结合,训练递归策略
  • 对比论文:与 Tree-of-Thought(ToT)的区别——ToT 仍是单上下文内的树搜索(PSPACE),递归模型是真正的栈式独立上下文(EXPTIME)

一页纸总结

维度内容
核心贡献两个 token(call/return)将 LLM 计算能力从 PSPACE 提升至 EXPTIME
关键概念递归自调用、栈帧隔离、PSPACE vs EXPTIME、合成 traces 训练
PM 必记CoT/ReAct 在理论上都是高级摘要,真正突破需要递归架构
面试金句"现有 Agent 框架的天花板是 PSPACE,递归模型突破到 EXPTIME,3B 打败 GPT-4o"
局限性仅在 Boolean SAT 验证,递归终止条件和延迟成本未充分讨论