一道应用题要先找数量关系,再计算结果。模型若直接输出答案,前面几步都藏在一次生成里。思维链提示会给出带中间步骤的示例,或者要求模型把解决过程展开。原始论文在算术、常识和符号推理任务上观察到明显提升。
我对照了 Google 的原论文、研究介绍和后续实证研究。最早的结果对模型规模很敏感。论文用八个思维链示例提示 PaLM 540B,在 GSM8K 数学题上得到当时很强的成绩。这个数字属于特定模型、示例和评测集,不能直接换算成任意业务任务的收益。
中间步骤给了模型更多计算位置
直接回答时,模型要在很少的输出 token 里完成判断。展开步骤后,它可以先写出已知条件,再逐步产生后续 token。前面的文字进入上下文,后一步可以继续参考。这种生成方式常能帮助多步问题,也会增加输出长度、等待时间和调用费用。
示例质量仍然关键。后续研究做过一个很有意思的实验,把演示里的推理步骤改成无效内容。在多项指标下,无效演示仍保留正确思维链 80% 到 90% 的表现。研究者发现,示例与问题是否相关、步骤顺序是否合理,对效果影响很大。模型可能学到的是回答形式和推进方式,未必逐字照着示例里的逻辑走。
这也提醒使用者,读起来顺畅的过程不等于可靠解释。模型可能在中间算错,随后碰巧给出正确答案,也可能每一步都像那么回事,结尾仍然错。思维链是生成内容的一部分,不能替代计算器、数据库查询或程序执行结果。
业务里先验证答案,再决定要不要展示过程
处理数学和结构化规则时,可以让模型先生成步骤,再调用代码核对最终结果。处理知识问题时,把关键事实交给检索来源验证。审核人员看到的是可检查的依据和工具结果,模型写出的长过程只作辅助。
有些模型不会公开内部推理,产品只返回简短说明或可验证摘要。这并不妨碍团队评测任务结果。准备一组含多步条件的测试题,分别比较直接回答、带示例提示和工具辅助三种方案,记录正确率、延迟和 token 用量。哪种方案稳定,就按任务选择。
还可以使用自洽性方法,让模型采样多条不同路径,再按最终答案聚合。它有机会提高准确率,费用也会按采样次数上升。多条路径得出同一答案只能增加信心,仍不能证明答案成立。高风险任务最后要落到外部证据或确定性检查上。
思维链最适合被当作一种任务策略。它给模型更多生成步骤,帮助处理部分复杂问题。团队需要负责的是结果验证,以及展示给用户的解释能否由真实来源和计算支撑。