一家机构把模型放在服务器上,用户只能通过接口提交输入并取得结果,参数和训练代码都不公开。模型仍可能被人仿走。攻击者准备大量输入,记录接口给出的输出,再把这些输入输出当成新训练集,训练一个替代模型。替代模型的权重未必和原模型相同,功能却可能很接近。

我把 2016 年的预测接口研究、2019 年的 Knockoff Nets 和 NIST 2025 年的攻击分类对了一遍。模型提取关心的是模型功能或参数,成员推断关心某条记录有没有参加训练,训练数据提取则试图拿到训练内容。三者都可能从查询接口开始,验收指标不能混在一起。

黑盒接口也会持续提供样本

2016 年的研究者只用黑盒访问,在当时的在线机器学习服务上测试了逻辑回归、决策树和神经网络。他们利用标签、置信度以及部分特征查询等接口能力,对多类模型做出高保真复制。论文还测试了一个直觉上的防守办法,只返回类别,不返回置信度。攻击仍然可以造成实质影响。

Knockoff Nets 把同一思路用到图像模型。攻击者先拿一批图片查询目标接口,再用返回的预测训练自己的网络。论文报告,即使查询图片与目标训练数据来自不同分布,替代模型仍可能学到有用功能;替代模型也不需要采用相同架构。论文当时还估算过,用商业图像接口做出一个可用副本,查询费用可以低到 30 美元量级。费用会随接口价格与任务变化,这个实验说明了公开查询可以快速积成训练材料。

NIST 对边界写得更细。攻击者有时追求参数和架构,有时只要一个功能相近的模型。后者可能已经足够绕过按次收费,或拿去准备更强的白盒攻击。精确复制在一些模型上做不到,功能替代依然值得防。

防守要看整段查询行为

减少概率位数、取消批量候选和缩小可调参数,会减少接口泄出的细节,却很难单独终止提取。标签本身就是监督信号。正常用户也会重复查询,所以简单按次数封禁又容易误伤。

更稳妥的做法是先给接口分用途。公开演示、付费业务和内部调试使用不同权限与速率。日志至少保留账号、时间、输入分布、返回字段和失败情况,同时避免把正文或敏感数据无期限写进日志。监测可以关注短时间大量覆盖输入空间、把查询分散到多个账号、长期规律取样,以及查询后迅速取消账号等行为。

高价值模型还需要准备一套替代模型评测。防守方用已授权的测试输入比较目标模型与可疑模型,记录标签一致率、概率接近程度和边界样本表现。水印、诱饵响应或法律条款可以补证据,使用前要评估误报和业务影响。

差分隐私保护的是单条训练数据影响,NIST明确提醒,它不为模型提取提供保证。接口安全也不能只写成防泄密。身份验证、配额、输出最小化、异常检测和响应流程要一起跑,模型上线后的查询才不会成为一份无人管理的训练集。

参考资料