跳转到内容

别只用回答长度判断 LLM 是否过度思考

进阶

来源:Google DeepMind · 发布于 2026-07-02最近复核于 2026-08-30

长推理不自动等于浪费,短回答也不自动等于高效。更可靠的问题是:新增一步有没有改变候选答案、补上证据或排除真实风险?如果没有效用,继续探索和反复确认才是“过度思考”的核心。

按 token 数设统一上限很方便,却会误伤难题,也会放过短但循环的推理。简单日期题可能被模型提出多个无关分支;答案已经稳定后,它又换一种说法重新验算。长度只看到结果,没有说明浪费发生在哪种结构里,因此也很难指导 prompt 或评测怎么改。

DeepMind 论文提出 TRACE:先把思考过程拆成“最小但完整”的子思考,再推断这些子思考之间的论述关系,组成 progression graph。研究在 Qwen3 与 DeepSeek-R1 蒸馏模型、五类简单问题数据上观察到两种常见模式:Explorer 不断开新分支,属于过度探索;Late Landing 已接近答案却迟迟不结束,属于过度验证。由此,过度思考应按步骤效用定义,而不是只按长度定义。

把 Agent 可见过程分成四类:提出候选、取得新证据、否定候选、重复确认。做代码任务时,读取一个新调用者可能有用;第三次重跑未变化的同一静态检查通常没有新信息。为任务提前写停止条件,例如“目标测试通过且 diff 与验收一致即停”,能抑制 Late Landing;限定先验证最高信息量假设,能减少 Explorer。

还可以给分支设预算:一次只保留两个最可能假设,只有当前证据不能区分时才扩展第三个。预算不是催模型猜答案,而是迫使每次探索说明“这一步可能排除什么”。高风险任务则把独立复核明确列入停止条件,避免把必要验证误删。

准备 20 个答案明确的简单任务,一半直接问答,一半允许调用本地计算器或搜索假数据表。分别使用普通提示和带停止条件的提示。只记录用户可见解释与工具轨迹,把每步标成“新增候选 / 新证据 / 排除 / 重复”,再统计正确率、步骤数和重复步比例。若产品不展示内部 chain-of-thought,就明确只分析可见轨迹,不能把它当成模型内部机制的复现。

成功证据: 20 个任务的输入、答案和轨迹标签可复查;带停止条件的一组在正确率不下降时减少重复步骤,且结论只覆盖可见轨迹。

停止线: 两组模型或工具不同、标签规则在看完结果后改变,或只能观察最终答案却仍推断内部思维结构时,停止归因。

  • “强制一句话回答就解决过度思考”只是压缩输出,未必减少内部计算或工具往返。
  • “重复检查一定没用”也不对。高风险写入、非确定测试和独立证据需要复核,关键是它是否改变置信度。
  • TRACE 是分析框架,不是已经证明适用于所有闭源模型的通用诊断仪。

官方页面提供摘要、作者与 ACL 2026 信息,结论针对论文列出的第三方模型和数据集。本文没有取得模型隐藏思维,也未复跑论文实验;实践部分是对“结构与效用”概念的可审计迁移。

本文是原创中文实践解读,不是逐句译文。英文原文见 Google DeepMind 官方论文页。