一个分类模型给一百张图片都报出八成把握,其中大约八十张判断正确,这组概率才算有八成把握的分量。它若只对六十张,模型就在过度自信。它若对了九十五张,概率又报得过低。置信度校准检查的就是预测概率与实际正确率能不能对上。
我把常被引用的校准论文和现在的工具文档对了一遍,最该先分开的有三件事。模型选对了多少叫准确率,能不能把不同类别分开属于区分能力,概率报得准不准才是校准。一个模型可以准确率更高,同时变得更会高估自己。
先把概率放进格子里看
可靠性图会把预测概率分成若干区间。落在 0.7 到 0.8 的样本归到一组,再看这一组实际有多少正例。每组的平均预测概率接近实际比例时,曲线才会靠近对角线。格子分得太细,单格样本太少,曲线也会抖,所以图旁边还应保留每个区间的样本量。
2017 年 ICML 的研究检查了图像和文档分类模型。论文中的 CIFAR-100 ResNet-110 示例,未校准时预期校准误差为 12.67,温度缩放后降到 0.96。这个结果来自特定模型和数据,不能挪成所有系统都能达到的承诺。它说明一个很朴素的办法有时已经够用。
温度缩放会在单独的校准数据上拟合一个参数,再把模型原有分数压平或拉开。正的温度不会改变类别分数的先后,最高分还是原来的最高分,因此分类准确率通常不动,概率可以变得更接近真实频率。校准集必须与训练集分开。用训练样本调到好看,只会把另一种过拟合藏起来。
对话模型报概率要另做验证
让大模型直接说“我有 90% 把握”,拿到的是模型生成的一段文字。它与分类器内部概率并非同一测量。已有研究在若干问答基准上发现,口头给出的概率有时比内部条件概率更校准,结果仍会随模型、提问方式和任务变化。
实际验收可以先挑一批答案已经核准的问题,让模型同时交答案与置信度。按置信度分桶,记录每桶正确率,再把合同、报价、医疗等高后果问题单独拆出来。样本分布变了也要重算。上月的校准曲线不能替本月的新客户问题作证。
Brier loss 和对数损失都能评估概率预测,单个总分还混有区分能力等因素。校准曲线、每桶样本量与业务错误成本放在一起,才知道阈值该放在哪里。低于阈值转人工,高于阈值继续自动处理,这个决定应由真实错误记录来定,不能看模型语气有多笃定。