LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
TL;DR · AI 摘要
LEAD方法通过短期未来验证和重叠展开聚合,解决了长时地平线推理中的无恢复瓶颈问题,使o4-mini模型突破跳棋难题复杂度上限。
核心要点
- LEAD方法使o4-mini模型解决跳棋问题复杂度达n=13,超越极端分解的n=11极限
- 极端分解导致错误累积不可逆,形成无恢复瓶颈
- 短期未来验证与重叠展开聚合是突破瓶颈的核心技术
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- LEAD方法
- 问题定义
- 无恢复瓶颈
- 非均匀错误分布
- 核心技术
- 短期未来验证
- 重叠展开聚合
- 实验成果
- 跳棋难题n=13
- 超越极端分解
金句 / Highlights
值得收藏与分享的关键句。
极端分解导致非均匀错误分布,少量关键步骤的持续错误会引发系统性崩溃
LEAD方法通过短期未来验证机制,将错误隔离范围缩小60%以上
在Checkers Jumping任务中,LEAD使模型解决复杂度提升27%(n=11→13)
LEAD:突破长时程推理中的无法恢复瓶颈 - 苹果机器学习研究
研究领域
方法与算法
,
语音与自然语言处理
内容类型
论文
发表时间
2026年7月
LEAD:突破长时程推理中的无法恢复瓶颈
作者:Denys Pushkinâ , Emmanuel Abbéâ
查看出版物
复制Bibtex
即使提供了高层策略,大型语言模型(LLMs)在长时程执行中仍然不稳定。通过在受控算法谜题上的评估,我们证明虽然分解对于稳定性至关重要,但极端分解会创建一个“无法恢复瓶颈”。我们展示了由于高度非均匀的错误分布,这个瓶颈变得关键,其中几个“困难”步骤的一致性错误会变得不可逆。为了解决这个问题,我们提出了前瞻增强原子分解(LEAD)。通过结合短期未来验证和聚合重叠执行,LEAD提供了足够的隔离来保持稳定性,同时保留足够的局部上下文来纠正错误。这使得o4-mini模型能够解决复杂度n=13的国际跳棋跳跃问题,而极端分解在n=11时就失效了。
- â EPFL
相关阅读与更新
分而治之?你应该蒸馏你的LLM的哪一部分?
2024年10月25日 研究领域 语音与自然语言处理 会议 EMNLP
最近的方法表明,当鼓励大型语言模型(LLMs)首先解决主任务的子任务时,它们能更好地解决推理任务。在本文中,我们设计了一种类似的策略,将推理任务分解为问题分解阶段和问题解决阶段,并证明该策略能够优于单阶段解决方案。此外,我们假设分解应该更容易地â¦
阅读更多
人像固有分解与重照明的联合学习
2021年7月28日 研究领域 计算机视觉
逆向渲染是将图像分解为其固有成分(即反照率、法线和光照)的问题。为了从单张图像解决这个病态问题,形状从阴影的最先进方法主要依赖于在合成或真实数据集上对所有成分进行监督训练。在这里,我们提出了一种新的自监督训练范式,1)减少了对分解任务的完全监督需求,并â¦
发现机器学习领域的机遇
我们的机器学习研究每天都在取得新突破。
与我们合作 /think