企业采购 AI 工具时,经常先问一句,上传的文件会不会拿去训练模型。这个问题当然要问。官方回答里即使写着“不用于训练”,数据仍然会被收集、传输、存储,也可能进入搜索和审计流程。
我对照了 Microsoft 365 Copilot 的数据说明和我国个人信息保护法。两份材料放在一起看,采购时应该继续追问文件会去哪、保留多久、谁能看见,以及删除请求怎样完成。产品名相同,个人版、商业版和接入第三方插件后的处理方式也可能不同。
不训练还要看保存
Microsoft 的官方说明称,Microsoft 365 Copilot Chat 的提示与回复在 Microsoft 365 服务边界内处理,并且不用于训练底层基础模型。这是一项明确的商业产品承诺。
同一份说明也写到,用户的提示与回复会形成 Copilot 活动历史,按照组织在 Microsoft 365 中的约定存储。保存聊天有实际用途,员工可以接着上次的工作,安全团队也能按权限做合规检查。企业需要知道保存期限由谁设置,普通员工能否自行删除,备份和审计记录又保留多久。
网页搜索还会多走一步。Copilot 为了补充最新信息,可以生成查询并发送给 Bing。官方文档说明这类查询与用户身份和租户标识分开处理。企业仍要检查原始提示里是否含有客户姓名、未公开项目名或完整合同句子。搜索只需要几个关键词时,就不要把整段内部材料带出去。
文件里有什么人
个人信息保护法对“处理”的定义很宽。收集、存储、使用、加工、传输、提供、公开和删除都在里面。把工资表上传给模型是处理,让插件读取客户聊天也是处理,把生成结果发给另一套系统仍然属于处理过程。
法律第五至第七条要求处理个人信息遵循合法、正当、必要和诚信原则,目的要明确合理,收集限于实现目的的最小范围,还要公开处理规则。企业因此需要先给资料分级。公开产品说明可以进入通用写作工具,内部流程文件要看账号和合同,含身份、金融或医疗信息的材料要走更严格的审批。
这里不能只靠员工记住“别传敏感信息”。工具入口若允许随手上传,忙起来总会有人图省事。管理员可以关闭暂时用不到的连接器,限制哪些团队能调用外部搜索,并给允许上传的资料类型写清例子。系统日志也要避免完整复制敏感正文。
采购时拿一份真文件走流程
演示阶段可以选一份经过脱敏的真实文件。先记录它从哪个账号上传,模型调用了哪些服务,生成结果保存在哪里。随后删除对话,再看后台、审计和备份中的记录如何变化。这次测试能把销售口中的“安全”变成一条可以复查的数据路径。
合同还要写明数据角色、保存期限、分包服务、跨境安排和事故通知方式。涉及具体业务时应由负责数据保护与法律事务的人核对,本文只提供一般检查思路。
企业把文件交给 AI,得到的是整理和查询能力,也开始了一次新的数据处理。训练条款看清以后,再沿着文件实际走过的每一步问下去,采购决定才有依据。