On the Limits of Innate Planning in Large Language Models
文章主要内容总结
该研究以8拼图任务为测试载体,在不依赖代码执行等外部工具的情况下,探究了4个大语言模型(GPT-5-Thinking、Gemini-2.5-Pro、GPT-5-mini、Llama 3.1 8B-Instruct)的内在规划能力和状态跟踪能力。研究采用零样本(Zero-Shot)、思维链(CoT)、思维算法(AoT)三种提示策略,结合重复、特定、提示性三级反馈机制,还引入外部移动验证器辅助模型筛选有效移动。结果显示,所有模型表现均存在显著缺陷:无外部工具时仅GPT-5-Thinking在AoT提示+提示性反馈下达到68%的成功率,且需消耗大量计算资源;即使有外部移动验证器辅助,所有模型仍无法完成任何拼图。核心问题集中在两点:一是内部状态表示脆弱导致频繁无效移动,二是启发式规划能力薄弱引发循环或无进展动作。
创新点总结
- 设计了无工具依赖的8拼图评估方案,通过统一协议隔离提示策略与反馈的独立影响,精准聚焦模型内在能力。
- 开展细粒度失败模式分析,不仅统计成功率,还拆解模型终止任务的具体原因(如无效移动、循环、提前停止等)。
- 引入外部移动验证器条件,剥离状态跟踪负担,单独评估模型的纯规划能力,量化了无状态跟踪瓶颈时的目标导向能力缺陷。
- 构建三级反馈机制与三种提示策略的组合实验,系统探究了不同干预手段对模型规划性能的调制效果。
Abstract 翻译
大型语言模型(LLMs)在众多基准测试中取得了令人瞩目的成果,但其规划能力和状态推理能力仍不明确。我们直接研究这些
