有些企业任务只要求把工单分成十个类别,或者从设备记录里抽取固定字段。把每次请求都送给最大的模型,质量可能很好,费用、延迟和数据流向却未必合适。小语言模型给了另一种选择,它更容易放进本地服务器、电脑,甚至移动设备。

我对照了 Microsoft 的 Phi-3 技术报告和 Google 的 Gemma 文档。小语言模型没有跨厂商统一的参数上限。Phi 系列把 3.8B、7B 和 14B 都列入小模型家族,Google 的轻量模型也覆盖多种规模。这个称呼更适合描述相对较低的计算需求与部署目标,不能只拿一个参数数字划线。

参数少只是起点

Phi-3-mini 有 38 亿参数,报告写明它使用 3.3 万亿 Token 训练,并包含大量过滤后的网页与合成数据。它提供 4K 和 128K 上下文版本,也经过监督微调、偏好优化和安全后训练。一个模型小,不代表训练简单,也不代表上下文一定很短。

Google 把 Gemma 定位为轻量开放模型家族,支持在移动设备、本地硬件或托管服务运行。官方选择指南建议先看任务能力、模型规模和计算条件。参数少通常会降低权重占用和每次推理的计算量,实际能否在目标设备运行,还受量化精度、上下文长度、KV cache、推理框架和并发数影响。

模型量化、知识蒸馏与小语言模型也要分清。量化是降低数值精度,蒸馏是让较小模型学习较大模型的行为,小语言模型描述最终模型的相对规模和部署位置。一个小模型可能经过蒸馏,也可以再做量化。验收时要记录最终权重格式和运行配置。

先拿窄任务测

小模型最容易在边界清楚的任务里发挥作用。工单分类、字段抽取、固定格式改写和本地知识库问答,都可以准备一组真实样本,分别测准确率、格式错误、拒答和延迟。需要广泛世界知识、复杂规划或长链条推理的任务,能力差距可能更明显。

公开基准能帮助初筛,不能替代业务样本。Phi-3 报告列出的 MMLU 与 MT-bench 成绩来自特定版本和评测方法。公司自己的中文缩写、表格格式和错误输入不在那些分数里。安全也要重测,尤其是模型接上内部文档和工具以后,原模型卡没有覆盖新增权限。

部署位置会改变选型理由。本地运行可以减少每次把文本发往外部服务的需要,也能在断网环境继续工作。团队同时要自己承担模型更新、访问控制、日志和漏洞修复。云端小模型则可能用更低单价换来更高吞吐,运维责任由服务商承担一部分。

我会先选能完成任务的最小候选,固定量化版本和上下文,拿真实样本对照一个更强模型。质量过线以后,再测目标机器上的首字时间、每 Token 速度、峰值内存和并发。若小模型在关键样本上持续失败,就升级模型或只把难题路由给更强模型。小语言模型省下的资源,要建立在任务确实做对的前提上。

参考资料