AI 数据安全:哪些信息不能提供给人工智能?
严格控制输入内容,是安全使用面向个人用户的语言模型的基础:一旦将信息提交给开放式 AI 工具,这些信息便离开了用户的本地环境。向 AI 输入机密数据可能导致信息泄露、商业秘密外流,甚至违反个人信息保护法规。因此,每次与这类 AI 工具交互,都应像公开发布信息一样谨慎。
哪些内容不能粘贴到 AI 中?
使用面向公众开放的模型时,切勿输入以下类别的信息:
- 个人信息——客户、员工或本人姓名、住址、身份证号码、电话号码和电子邮箱地址;
- 医疗记录——病史、检查结果和患者诊断信息;此类信息受到严格的法律保护,例如《个人信息保护法》或 HIPAA;
- 企业机密信息——尚未发布的财务报告、营销策略、客户数据库,以及并购或裁员计划;
- 商业秘密——软件源代码、生产配方、独有算法及企业内部技术文档;
- 密码和凭据——API 密钥、登录凭据、授权令牌、支付卡信息及各类加密密钥;
- 受版权保护的材料——用户没有相应使用许可的整本书籍、付费学术论文或脚本;
- 违法内容——宣扬暴力或仇恨的材料,以及实施违法行为的操作指南。
输入 AI 的数据会经历什么?
提交给云服务提供商的数据可能经历多个处理和分析环节,其生命周期并不会在 AI 生成回答后立即结束。
模型训练
输入标准版个人用户生成式 AI 工具的数据,往往可能被用于后续模型训练。这意味着,输入的信息可能影响神经网络的参数;理论上,其中的某些内容也可能在日后出现在对其他用户的回答中。
人工审核与内容审查
除了自动处理,AI 系统还设有安全过滤机制。如果算法认为某条提问可疑,例如可能违反服务条款,对话就可能被标记并交由人工审核。这意味着,服务提供商的员工或外部数据标注人员可能直接查看输入内容,以改进内容审查机制。
数据存储与备份
AI 服务提供商会在服务器上保存对话记录,以维持服务、排查故障,并在后续会话中保留上下文。需要注意的是,用户在界面中删除聊天记录,通常不代表服务器上的信息会立即删除。数据可能继续留存在提供商的备份系统中一段时间;如果云基础设施遭到网络攻击,机密信息因此面临暴露风险。
个人账户与企业账户:保护程度有何不同?
AI 数据的安全保障水平,很大程度上取决于订阅类型和部署方式。
免费及付费的标准个人账户在许多热门服务中,默认可能允许将提交的信息用于模型训练。因此,如果用户输入了机密内容,每次会话都可能带来信息失控或泄露的风险。
企业及大型机构使用的环境,例如 Enterprise 账户,或通过 Microsoft Azure、AWS、Google Cloud 等提供商的 API 在私有云中部署的服务,通常采用更严格的保护标准。提供商会承诺符合 ISO 27001、SOC 2、《个人信息保护法》等适用的安全或合规要求,并在 SLA、DPA 等协议中声明,客户数据不会用于训练公开的基础模型。在这类环境中,数据输入限制可能相对宽松,但仍需制定风险管理政策并实施访问控制。
哪些内容可以安全地输入 AI?
虽然需要遵守多项限制,仍有不少信息通常可以提供给 AI 处理,例如:
- 公开可获取的材料——开放获取的文章、博客文章、公开市场报告、法律法规,以及网站上的公开内容,例如维基百科条目;
- 非机密信息——一般性说明、理论概念问题、语法与拼写规则、数学方程和词义查询;
- 已匿名化的文档片段——完全去除了独有变量、密钥、客户名称和内部架构信息的文书模板、合同样本或代码片段;
- 自己的创作草稿——不含敏感商业数据的邮件草稿、社交媒体帖子、演示文稿提纲或文章;
- 开放数据集——用于学习数据分析和格式处理的合成数据,或来自公共数据仓库的统计资料。
发送给 AI 前,如何有效地匿名化消息和数据?
在将机密文档发送给语言模型之前,应先妥善处理文档,清除其中的敏感信息。这样才能在降低机密数据泄露风险的同时,利用 AI 处理文本。
替换身份标识与代号化
代号化是用虚构标识替换敏感数据。例如,将姓名“张三”替换为“[客户_1]”,将公司名称“甲公司”替换为“[机构_A]”。这样既能保留文档的结构、语法和上下文,供语言模型理解,又能避免直接识别原始对象。
敏感信息的掩码处理
掩码处理是直接隐藏关键字符串,通常用特殊字符替换部分内容,例如将银行卡号写成“4532 **** **** ****”。另一种有效方法是将数据概括化:不提供精确数值,例如月薪 12,000 元,而改用区间表述,例如“月薪 10,000–15,000 元”,以降低重新识别个人身份的风险。
自动化处理:DLP 与 RegEx 工具
手动清理长文本容易遗漏信息。在专业环境中,可以使用基于正则表达式(RegEx)的脚本,或 DLP(数据防泄漏)系统。这些工具能够在提示词发送前自动扫描内容,识别并阻止或替换符合身份证号码、纳税人识别号、电子邮箱地址或银行账号等格式的字符串。
如何阻止 AI 使用你提供的信息训练模型?
除了谨慎选择输入内容,还可以通过配置工具本身来降低风险。多数服务提供商都提供退出训练数据共享的设置。
- ChatGPT(OpenAI)——在账户的“Settings”中,进入“Data controls”,关闭“Improve the model for everyone”,即可停止将此后输入的内容用于模型训练。按当前界面设计,这不会删除用户可见的对话历史。出于滥用监测和安全目的,OpenAI 仍可能在服务器上保留相关日志一段时间;具体保留期限应以其最新政策为准。
- Gemini(Google)——在隐私设置中关闭“Gemini Apps Activity”。此后新对话不会保存到 Google 账户,也不会用于模型训练。不过,这不代表日志会立即从提供商的基础设施中消失;Google 仍可能出于服务安全目的短期保留相关数据。
- Claude(Anthropic)——免费及标准个人用户版本的默认数据使用设置可能允许将输入内容用于改进模型。这与 Anthropic 早期强调不使用用户对话进行训练的做法有所不同。若要关闭这一机制,请进入账户设置中的隐私选项,停用“Help improve Claude”。
请注意,更改隐私设置、关闭训练数据共享通常只对之后的使用生效。此前提交的数据不会因此自动从系统中删除;如果已进入模型训练流程,也无法仅靠更改设置将其撤回。
总结
- 使用面向个人用户的 AI 工具时,应像公开发布信息一样谨慎,不要输入个人信息、医疗记录、密码或商业秘密。
- 提交的信息可能经过模型训练、内容审核及服务器备份等多个处理环节。
- 输入前进行匿名化、对敏感字符串实施掩码或代号化,并使用专门的 DLP 工具,有助于降低风险。
- Enterprise 账户及专用企业云环境通常提供更严格的保护,并可通过协议约定客户数据不用于训练公开模型。
- 关闭训练数据共享通常只对之后提交的内容生效,无法撤回此前已进入训练流程的数据。
发表回复