同一道计算题让模型答五次,出现四个相同答案,人很容易多信一点。这个直觉被研究成了一种具体方法,叫自洽性解码。查过原始论文、Google Research 的论文页和 OpenAI Cookbook 的可靠性说明后,可以把它的动作说得很清楚。模型先走多条推理路径,再按最终答案的一致程度汇总。
原论文把自洽性放在思维链提示之后。普通贪心解码只留一条路。它每一步都选概率较高的后续,最后得到一个推理过程。自洽性会多走几条,让模型用不同过程处理同一问题,然后把路径中得到的答案归在一起,选择总体上最一致的结果。
多条路径要真的有差别
方法成立依靠一个朴素条件。复杂问题可能有几种推法,其中多条正确路径会到达同一答案。采样若几乎每次都生成同一段文字,就没有得到多少额外信息。温度和采样设置若放得太开,又可能得到许多跑题内容。论文里的配置属于特定模型与基准,换模型后仍要重新测。
研究在 GSM8K、SVAMP、AQuA、StrategyQA 和 ARC-challenge 等算术与常识推理任务上做了实验。论文报告 GSM8K 提升 17.9 个百分点,其他任务也有不同幅度的变化。这些数字说明方法在那组条件下值得研究,不能直接写进企业方案当作预期收益。合同核对、客服分类和开放式写作的答案形态都与数学题不同。
归并有门槛。选择题和数值题容易统计相同结果,两段自由文本却可能意思相同、措辞不同,也可能表面接近却条件相反。若还要另请模型判断哪些答案等价,系统又增加了一层评测误差。业务使用时最好先挑最终结果可明确比较的任务。
多数票也会一起错
五条路径都用了同一份错误资料。最后很可能得到一致的错误答案。模型对某个常见误解有稳定偏好时,多采样只会反复确认它。自洽性提供的是模型内部的重复判断,不能代替外部来源、计算器或人工验收。
成本也会上升。生成五条长路径,Token 用量和等待通常都会高于生成一条,OpenAI Cookbook 在可靠性技术说明中也把额外计算列为代价。实际产品可以先把它留给少量难题,并记录采样次数、耗时、费用以及最终是否真的改对。简单问题若单次已经稳定,就没有必要固定生成很多份。
我更愿意把自洽性看成一次小型复核。它能暴露答案是否摇摆,也可能从多条路径里找出共同结果。上线时还要保留外部校验。对于金额、日期、法规和客户数据,一致只说明模型几次说得一样,事实成立还得另找证据。