公司想训练一个工单分类器,手里只有几百条已标注问题。让大模型按照类别生成更多样本,看上去能很快补齐数据。这样的人工样本属于合成数据。它可以解决一部分稀缺和共享限制,也会把新的误差带进训练。
我查了英国信息专员办公室的隐私增强技术指南、NIST 的差分隐私材料和相关论文。合成数据通常由算法学习真实数据的模式与统计属性,再生成新的记录。它可以只替换部分字段,也可以生成一套完全人工的记录。每条记录看起来像真的,原则上不对应原来那个人。
人工生成不等于没有个人信息风险
合成器仍可能用真实客户、病人或员工数据训练。源数据在生成阶段怎样收集、谁能访问、保存多久,依然需要管理。模型若记住少见记录,输出又与某个真实人过于接近,攻击者可能结合外部信息重新识别。
NIST 提醒,不满足差分隐私的合成方法通常只能提供非正式的隐私保证。删掉姓名和手机号也不够,年龄、地区、职业与罕见经历组合起来,仍可能指向具体个人。需要强隐私承诺时,应检查生成方法是否真的满足可说明的差分隐私条件,并评估隐私预算和数据可用性。
这里有一道难取的平衡。合成数据越准确地复现真实分布,分析和训练越有用,它也更可能保留稀有模式。加大随机扰动能降低泄露风险,却会损失细节。团队需要分别做隐私攻击测试和任务效果测试,不能用一句“数据是合成的”代替两套证据。
原始偏差会跟着过来
真实数据漏掉某些地区、年龄或表达习惯,生成器学到的范围也会偏。合成一百万条不会自动补回从未出现的人群。NIST SP 800-226 还指出,生成过程会在原有统计误差之外再加一层不确定性,少数群体的准确率可能降得更明显。
文本数据还要防止模型自己喂自己。关于模型坍塌的研究在其统计设定中发现,连续几代只用前代模型生成的数据训练,会逐步丢失真实分布里较少见的部分。合成数据与经过授权、质量可控的真实数据混用,保留数据来源和生成版本,风险更容易被发现。
合成数据确实有合适的位置。大模型可以为小模型生成带标签样本,测试团队可以用虚构姓名和账号构造敏感信息泄露场景,开发环境也能避开直接复制生产库。每种用途都要先写验收标准。分类任务看各类别准确率和混淆情况,隐私用途做重识别与成员推断评估,测试数据则检查能否覆盖真实失效方式。
我更愿意把它当成一种有来源、有生成参数的数据。记录原始样本范围、提示词、生成模型、过滤规则和抽样日期,再留一份真实验证集。合成数据能补训练材料,最终判断仍要回到真实任务和真实人群。