两个模型都说自己更快、更准,企业很难只靠产品页做决定。公开榜单可以帮人缩小范围,最后还得把合同问答、客服分类或资料抽取这些真实工作拿出来跑一遍。

我把 NIST 的 AI 风险管理框架、OpenAI Evals 和 Google 对测试集的说明放在一起看。三份材料都指向一件很具体的事。评测要写清任务、样本、评分办法和运行条件,而且上线以后还要继续看。

先把好答案写成能打分的标准

“回答质量高”很难验收。客服知识问答可以拆成几项可观察结果。答案有没有引用正确制度,是否把旧版本当成现行规则,资料不足时会不会停下来,回复时间与单次成本是多少。每项都要说明怎样算通过,谁负责处理有争议的样本。

有些结果适合程序评分。分类标签能与标准答案比较,JSON 字段能按 schema 验证,引用链接可以检查是否存在。涉及语气、完整性与业务判断时,还需要懂流程的人看。OpenAI 的 Evals 把测试标准、数据源和 grader 分开配置,正好提醒团队把“谁来判”和“按什么判”留下记录。

NIST 的 Measure 部分要求记录测试集、指标和使用的工具,也要求评测条件接近部署环境。测试时给模型一份整洁样例,上线后却让它面对扫描合同、缩写和缺字段,离线分数很快会失去意义。验收材料应保留业务里常见的脏数据,同时去掉真实姓名等不该进入评测系统的信息。

留一组问题到最后再看

团队调提示词时会反复查看结果。看得多了,人会针对熟悉题目修改规则,分数随之上涨。Google 的机器学习材料建议区分训练、验证和测试数据。验证集用于日常调整,测试集留到候选方案基本定下后再做一次核对。

重复样本也会把成绩抬高。同一份制度改了文件名,或者一条客服问题只换了称呼,模型可能已经在前面的样本里见过。Google 明确建议删除测试集与训练集之间的重复内容,并让测试数据尽量代表真实使用。企业自己的评测集也该做语义去重,记录每条问题来自哪类业务。

模型、提示词、检索资料和工具权限都要带版本。只写“某模型通过九十分”,几周后很难重现。更换模型版本时,应在同一批固定样本上重跑,再补一批最近出现的新问题。这样能分清成绩变化来自模型,还是来自资料更新与规则修改。

上线以后继续收失败样本

NIST 要求 AI 系统在运行中持续监测。客服人员改掉的答案、用户追问两次才解决的问题、引用错版本的记录,都可以进入候选评测集。先脱敏,再由业务负责人确认标准答案,随后加入下一轮回归测试。

评测集会随着业务变化。旧政策废止后,相关问题仍可保留,用来检查模型会不会引用过期文件。新产品上线,也要加入新名称和容易混淆的旧名称。团队维护的是一份能反映当前工作的题目,不是一张永远不动的考试卷。

选模型时,价格和公开分数仍然要看。真实问题跑过一遍以后,采购方才能知道哪种错误最多,人工要补多少工作,以及便宜模型是否已经够用。这份评测记录也给后续换模型留下一条可复查的基线。

参考资料