规划

How Transformers Learn to Plan via Multi-Token Prediction

2026-07-28arxiv.org

研究分析 Transformer 模型如何通过多 token 预测机制自发涌现规划能力。

值得记下

多 token 预测作为一种训练目标,不是直接教模型规划,而是让它自发形成规划行为。这种从训练范式入手分析推理能力的思路,对理解 LLM 内部机制具有方法论意义。

阅读原文

内容来源:arxiv.org,版权归原作者所有