Wind_Mask的博客

关于Secret的沉思(特辑):法学硕士时代

最后更新于

17 min read


法学硕士时代的隐私

是的,如此显而易见的悲催的:

“中国人更加开放,对隐私问题没有那么敏感,很多情况下他们愿意用隐私交换便利性,那我们就可以用数据做一些事情。”

现在看来真是时代的先声。 只不过姹紫高估了无毛猴子的水准,在法学硕士这样的伟力面前,其实不管哪国人都一样。

The Navier–Stokes equations

第二次千禧年问题的解前,人们居然才发现法学硕士提供商吸收了我们的一切,包括炼化了数学家的idea。

大厂的数据政策

Openai

对于个人这些小东西,openai是这样说的:

面向个人的服务,例如 ChatGPT 和 Codex 当你使用 ChatGPT 和 Codex 等面向个人的服务时,我们可能会使用你的内容来训练我们的模型

你可通过我们的隐私门户,点击“请勿使用我的内容进行训练”选择退出训练。如需关闭 ChatGPT 对话及 Codex 任务的训练功能,请遵照我们《数据控制常见问题解答》中的说明操作。一旦你选择退出,新的对话将不会用于模型训练。

对于已关联的青少年账号,家长或监护人可以通过家长控制来管理是否允许将对话用于改进我们的模型。

即使你已选择退出模型训练,仍可就产品使用体验向我们提供反馈(例如,对模型回复点“赞”或“踩”)。如果你选择提供反馈,与该反馈相关的整段对话可能会用于训练我们的模型

如果你在“设置”中启用了训练功能,你的支持对话可能会用于改进 OpenAI 服务,包括我们的模型。

使用 ChatGPT 时,你还可点击聊天界面右上角的图标启用“临时聊天”功能。“临时聊天”中的对话不会出现在历史记录中,不会被用于创建或调用记忆,也不会用于模型训练

Codex 针对完整环境的训练权限设有单独控制选项,你可在 Codex 设置中进行管理。请注意:在 ChatGPT 界面或隐私门户中调整的设置,不会影响 Codex 的这些完整环境训练设置

对于API请注意:

您的数据就是您的数据。 截至 2023 年 3 月 1 日,发送到 OpenAI API 的数据未用于训练或改进 OpenAI 模型(除非您明确选择加入与我们共享数据)。

(这个截至时间有点,,,)

滥用监控日志可能包含某些客户内容,例如提示和响应,以及源自该客户内容的元数据,例如分类器输出。 默认情况下,所有 API 功能使用情况会生成滥用监控日志,并保留长达 30 天的时间,除非法律要求更长的保留时间,或者合理地保护我们的服务或任何第三方免受伤害。

当然,如果你是唉资本,一切都好:

面向企业的服务(如 ChatGPT Business、ChatGPT Enterprise 及 API 平台) 默认情况下,我们不会将企业用户在旗下产品(包括 ChatGPT Business、ChatGPT Enterprise 及 API)中的任何输入或输出用于模型训练。我们为 API 客户提供自愿选择与我们共享数据的渠道(例如通过 Playground 提供反馈),这些数据将用于模型改进。除非组织明确选择参与,否则默认不启用数据共享功能

Anthropic

相比之下,A\就哈哈了:

为了确保我们负责任地部署受保护的模型,我们要求有限的数据保留和审查作为我们安全工作的一部分。提交给受保护模型的提示和由受保护模型生成的输出将保留30天以支持我们的安全工作,在提供这些模型的每个平台上。

此处受保护模型到本文更新时间为止,指的是Mythos 5Fable 5系列的全部模型。

至于平时政策:

If You Allow Us to Use Your Data to Improve Claude If you allow us to use your chats or coding sessions to improve Claude, we may retain your data in a de-identified format for up to 5 years in our model training pipelines.

If you decide to turn off the model improvement setting, we will not use your previous or new chats or coding sessions for future model training. Additionally, if you delete a chat from your chat history, it will not be used to train future models. Your data will still be included in model training runs that are already in progress, or in models that have been trained.

We retain inputs and outputs for up to 2 years and trust and safety classification scores for up to 7 years if your chat or session is flagged by our automated trust and safety systems as violating our Usage Policy.

Where you have provided feedback to us (e.g. by submitting feedback through our thumbs up/down button or sent bug reports), we retain data associated with that submission for 5 years.

We may anonymize or de-identify your personal data for research or statistical purposes, in which case we may retain this information for longer.

那么,对于商业难道就好了吗?

Standard Retention Timeframe For Anthropic API users, we automatically delete inputs and outputs on our backend within 30 days of receipt or generation, except:

  • When you use a service with longer retention under your control (e.g. Files API)
  • When you and we have agreed otherwise (e.g. zero data retention agreement)
  • If we need to retain them for longer to enforce our Usage Policy (UP)
  • In compliance with the law

此外,上文提到的保护模型仍然:

Additionally, for Covered Models, we require limited data retention and review as a part of our safety work. To learn more about Covered Models and these requirements, see here.

此外是Usage Policy Violations以及Feedback Data,这些反正都是:

如果您与我们的合同允许,我们可能会将贵组织的数据匿名化用于研究或统计目的,在这种情况下,我们可能会将此信息保留更长时间。

在隐私政策中也说明了:

Personal data we collect or receive to train our models

  • Data that our users or crowd workers provide, including Inputs and Outputs from our Services (unless users opt out)

而且:

除非你通过账户设置选择退出,否则我们可能会使用你的输入和输出来训练和改进拟人型AI模型。即使您选择退出,我们也会在以下情况下使用输入和输出进行模型改进:(i) 您的对话被标记为安全审查以提升我们识别有害内容、执行政策或推动AI安全研究的能力,或(ii)您明确向我们举报了相关材料(例如通过我们的反馈机制)。

最后才是唉资本勉强获取的一点:

部分Claude平台(Claude API)及企业客户代码,在Anthropic批准下,可能存在协议,除非为遵守法律或防止滥用或损害,否则Anthropic不存储其输入或输出。根据这些安排,Anthropic仍保留用户安全分类器的结果,以执行我们的使用政策。这些安排与Anthropic默认的数据保存方式不同。

Under these agreements, the only products to which zero data retention applies are eligible Anthropic APIs, Anthropic products that use your Commercial organization API key (including Claude Code accessed via the API), and Claude Code for Enterprise plans. To learn more about eligible Anthropic APIs, see our Developer Docs. To learn more about Claude Code on Enterprise plans, see our Claude Code Docs.

请注意此处适用于Claude Code的ZDR不是商业默认的:

ZDR 不包含在 Enterprise 的标准 Claude 中,并且无法从您的管理设置中启用。 它适用于合格帐户,需要人工单独启用。 如果您的组织需要 ZDR、联系销售人员或您的人性客户团队以确认资格。

而且此处ZDR不包含Chat on claude.aiCowork

Claude Fable 5.1 and Fable 5 are Covered Models that require data retention by default.

并且:

即使启用了 ZDR,Anthropic 也可能会根据法律要求保留数据或解决使用政策违规问题。 如果会话被标记为违反政策,Anthropic 可能会将相关输入和输出保留长达 2 年,这与 Anthropic 的标准 ZDR 政策一致。

第三方云服务商

对于第三方,情况各不相同,但基本上都支持了唉资本的数据保留政策, 我想对于采供这些服务的实体来说,大概不会难于处理。

国产模型

这事似乎说来有点微妙,但是贯彻我们Secret的原则,必须还是指出来: 首先,网页免费聊天默认肯定是用于训练的,这没什么可想。 而其他的使用,国内几家主要模型开发上游默认是用于训练的,其中几个:

DeepSeek:

为向您提供连续、高质量的服务,在经安全加密技术处理和去标识化前提下,我们可能会将服务所收集的输入及对应输出,用于DeepSeek模型训练和服务的优化。如您拒绝将您的数据用于模型训练,可以在产品内通过关闭“数据用于优化体验”来选择退出,关闭后您的输入和输出不会再用于我们的模型训练。

但是这个关闭“数据用于优化体验”仅存在于网页聊天界面的账号设置中,对于开放平台的API则没有说明。

Kimi API表示:

用户数据会被用于模型训练吗?

不会。 通过 API 提交的用户数据(包括输入内容和模型输出)不会被用于训练或改进 Kimi 的模型。你的数据仅用于完成当次 API 请求,处理完成后不会被持久化存储用于训练目的。

而Kimi的个人plan则没有相关讨论。

Z.AI 表示:

b) The Company do not store any of the content the Customer or its End Users provide or generate while using our Services. This includes any texts, or other data you input. This information is processed in real-time to provide the Customer and End Users with the API Service and is not saved on our servers.

其 teamplan 则宣称:

默认情况下,数据不用于模型训练:默认情况下,将代码、提示、对话和相关内容排除在模型训练之外,有助于保护组织的核心研发资产。

然而其个人plan自然也不用说。

云服务商没有训练需求,几家云服务商部署的开源模型可能存在ZDR的服务,需具体分析。

模型厂总结

总的来说,不论国内外模型厂商,基本上免费网页chat及个人订阅服务都是默认加入训练的,而API和商业服务一般为否。 其中前者可能有opt out选择,需要手动开启。

第三方云服务部署的MAAS则一般符合云平台的隐私策略。

各渠道

间接的API渠道:

这些渠道订阅服务则视情况默认开启/关闭ZDR策略,此外取决于上游供应商。


当然写到这我们会发现上文如此平庸以至于根本不符合本系列的激进考量,这不外乎是迎合了现在法学硕士爱好的风潮而已。

而真正坚持原典系列味道的讨论当然是关于本地部署模型──然而不外乎是💰的问题。

隔离

退一步讲,那么不外乎是隔离的信息空间以隔绝法学硕士的窥探。 这方面传统的沙盒方法都可考虑,比如systemd-nspawn或者更进一步的VM方法。

我现在感到,专为代理设置的特设沙盒大抵也犯了苦涩的教训似的的错误,因此不再研究特别发展出的这些产品,而是优先考虑使用容器/虚拟机的一般方法,这同时也适用于权限控制,因此取代了各家agent自己发明的多余控制──事实上,我支持YOLO

但是,当然的,我不会在此讨论如何配置潮裤的code agent插件扩展和设计,这种被一切无聊包围了的是无趣的。

论草台

就在我发表本文后第二天,人类学发布了 Detecting and countering misuse of AI: September 2026

现在人们总该知道这世上并没有那么美好的2B故事: 这不难理解,为了“降本增效”,必须大干快上氛围编码── 但是传统的慢速企业IT项目制度是不可能跟得上AI的迭代速度的, 况且现在也没有算力和人力去部署── 因此唯一的办法只能是自寻出路。

我之前还怀疑,真的有商业开发敢使用个人plan吗? 但是想了想各路草台毕竟。

现在人类学告诉了我们结局, 此外还有一个关于从中转站购买数据的帖子在此不引了。

这背后的安全问题将成为法学硕士时代的电幕力量


最后,也是在Navier–Stokes equations的问题被AI神力扯下花头的日子,对于这启示录般的末期氛围,我们还能做什么呢?

你们听见打仗和扰乱的事,不要惊惶;因为这些事必须先有,只是末期不能立时就到。