mt logoMyToken
ETH Gas
EN

Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近

Favoritecollect
Shareshare

作者: 王子伊 ,晚点LatePost

编辑丨程曼祺

商业逻辑比技术逻辑更重要。

2026 年 9 月 10 日,Anthropic 发布了一份 154 页的报告,称它识别并阻断了 7 家中国 AI 实验室针对 Claude 的大规模蒸馏。

蒸馏本是一种常见的模型训练方法:开发者用更强模型生成数据,再用这些数据训练自己的模型去模仿领先模型。Anthropic 将未经授权、大规模、隐蔽提取模型能力的行为称为 “不正当蒸馏”(illicit distillation)。

Anthropic 称,相关机构在提取前沿模型的输出时,使用了一些明显违规的手段:如利用被盗的信用卡、登录凭证和 API 密钥批量建立虚假账号。

报告还称,一些中国模型公司把用户请求转发给 Claude,或从第三方路由服务购买用户对话,用这些数据训练模型。部分对话包含姓名、企业数据和有效的访问凭证。

这不是 Anthropic 第一次指控 “蒸馏攻击”。2026 年 2 月,它称 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超 1600 万次交互。此后,Anthropic 加高了防线。OpenAI 和 Google 也在持续识别和应对蒸馏攻击。

这些措施能防住蒸馏吗?

澳大利亚格里菲斯大学助理教授刘艺表示怀疑。他长期研究人工智能与网络安全,曾任 Quantstamp 人工智能研究科学家。他参与的 2023 年提示词注入研究,被全球性安全组织 OWASP 的 LLM 01 条目列为参考文献。他还曾两次获得 Anthropic 的安全漏洞赏金,并研究过顶尖商用模型的思维链窃取攻击。

刘艺分享了他的核心判断:

以 Anthropic 为例,美国前沿模型公司目前主要设置了三层蒸馏防线:

(1)利用专门用于检测对抗性数据提取的分类器,让模型内生地拒绝可疑请求;

(2)在架构设计上隐藏或压缩思维链再输出;

(3)用外部检测器识别数据提取,随后中断请求或封禁账号。

反蒸馏是个伪命题。理论上蒸馏很难杜绝,美国前沿模型公司更现实的目标是提高数据采集成本,拖慢竞争对手,延长领先时间。

对美国前沿模型公司来说,反蒸馏保护的不只是模型能力,它们要捍卫的,还有在建立在技术领先之上的商业价值。

刘艺认为,理解美国前沿模型公司的反蒸馏行动,商业逻辑比技术逻辑更重要。

Anthropic 能识别疑似蒸馏的行为,却很难获得蒸馏确证

晚点 :Anthropic 9 月 10 日发布报告,指控 7 家中国 AI 实验室进行不正当蒸馏。这里的 “蒸馏攻击” 具体指什么?

刘艺 :目前主流的大模型由三部分组成:用户的输入,中间推理的思维链(chain of thought),模型的输出。现在 Anthropic、OpenAI,会隐藏中间的思维链,只给你最终回答。对复杂推理任务,抠出思维链就是一种蒸馏攻击方式。

晚点 :推理轨迹和 Agent 完整轨迹等数据为什么对提升模型能力如此重要?

刘艺 :你可以把思维链理解为一个更强模型已经做出来的解题答案,是可用于模型训练的高质量数据。

大模型性能由参数量(N)、数据量(D)、计算量(C)三者共同决定。参数量各公司增加得都比较快,在时间和算力有限的情况下,公司想更快提升模型能力,就需要更多高质量的数据。

但构造复杂、长程任务的优质数据非常难,真实世界中有价值的训练数据又越来越少。所以一些大模型公司,会用各种各样的方式蒸馏更高级的模型。

晚点 :怎么把思维链和更多任务轨迹抠出来?

刘艺 :这有各种技巧组合。比如通过编码(encoding)、越狱(jailbreaking)、提示词注入 (prompt injection),再通过各种各样的催眠,不停地给 AI 立人设,让它相信自己是一个研究员,正在做一件艰难但很有意义的事,让它需要专注解决任务。我跟国内的人交流不是很多,但我了解到,国外做 AI 的人有在这么还原思维链——基本上看一下 paper,你就知道大家的思路。

除了直接把原生的思维链拿出来,还可以尝试根据输入、输出合成中间的思维链。据说,一些数据公司专门出售长程任务的思维链,800-1000 元一条。

晚点 :在 Anthropic、OpenAI、 Google 之中,谁被蒸馏得最多?

刘艺 :根据目前的公开报道,应该是 Anthropic。但我觉得不好说。我看了 DeepSeek、GLM、Kimi、Anthropic 和 Open AI 各家思维链的实际文本,语言风格其实没太大差别。不好说是谁蒸谁的,有可能最开始他们还去蒸馏了 DeepSeek。

晚点 :技术上通常如何识别蒸馏攻击?从 “这批请求很像蒸馏” 到 “这就是某一机构的蒸馏”,中间需要怎样的证据链?

刘艺 :Anthropic 更多依据调用行为去判断。比如,某些账号突然发出大量请求,集中提取某些固定的数据集。

Anthropic 会先定位异常账号,再寻找不同账号共享的模式,比如相同的系统提示词。因为各家公司使用的 Agent 架构(harness)不同,系统提示词也不同,能以此识别出背后的公司。例如借助前缀缓存(prefix caching),Anthropic 可以发现哪几组提示词共享同一个缓存,又和目前已知的这些系统提示不一致,那就很容易定位到蒸馏者。

晚点 :识别异常账号后,Anthropic 能进一步实锤自己的数据是否被训进了某个特定的模型吗?

刘艺 :很难 100% 实锤。它可以指控某家公司尝试蒸馏 Claude,却很难证明某些数据真的进入了对方的模型。

GLM、Kimi、DeepSeek 虽然都是开源模型,但只开源了权重,不会开源数据集。而从模型权重,很难得到蒸馏的确证。否则,Anthropic 就不用在报告里说得那么隐晦,只重点描述了中转站的运作——本质是因为无法用白盒的方法分析。

再比如,你可以去问大模型《哈利·波特》第一本书的前 100 个词,它大概率会回答你。但这不代表它直接训练过原著,也可能来自引用原文的博客或书评。

晚点 :也就是说,“蒸馏攻击” 很难被完全证实,也很难被证伪。

刘艺 :Anthropic 可以通过平台侧的调用记录、账号关联和基础设施信息形成比较强的归因证据,但这和从最终模型本身证明某一批 Claude 数据确实进入了训练,是两个不同的问题。后者在技术上要困难得多。

反蒸馏提高了对手的采集成本,也可能 “误伤” 普通用户

晚点 :当前美国前沿 AI 公司,有哪些应对蒸馏攻击的具体技术方法?

刘艺 :我认为分为三类。

第一,内嵌检测,Anthropic 应该有专门针对思维链提取的分类器(classifier),一旦检测到思维链相关的状态被激活了,就可以制止提取的行为;

第二,从产品架构上隐藏,模型不再输出原始思维链,而是先压缩、总结,再输出;

第三,外挂检测,比如它可以看输出内容是不是和自己的思维链有重叠(overlap),如果达到了某些泄露的阈值,就会制止输出。类似行为多了之后,号就会被封掉。

晚点 :Anthropic 的报告里没有涉及这些细节,你是如何了解的?

刘艺 :这是我自己的推测,因为这是比较常见的操作。为什么 Anthropic 会发布漏洞赏金计划来测试自身的安全防御措施?它想花钱来买人们jailbreak它的提示词——一旦发现某个东西被攻破了,它马上就会训到自己的分类器里,所以下一次攻击就会越来越难。

晚点 :你曾两次获得 Anthropic 的安全漏洞赏金,当时是一个怎样的过程?

刘艺 :我当时花了大约 2 到 3 周,主要是在 Anthropic 授权的漏洞赏金项目范围内,对它的安全分类器进行对抗测试(Adversarial Testing),尝试寻找能够绕过现有防御的输入。因为攻破就是 zero or one,只有成功和不成功,没有 0.5 的状态。当时任务的目标是做一些 Anthropic 指定问题的获取,不直接涉及还原思维链。但有些逻辑是类似的。

晚点 :防范蒸馏攻击的操作,会不会误伤正常订阅用户?

刘艺 :正常订阅的用户应该还好,触发风控的主要是一些异常用户,比如说中转站的账号,或者尝试去攻击 Claude 的账号。

我记得 Anthropic 的报告里,还披露了 2 个湖南某大学的本科生自己设计了一套做网络安全的 Agent,用它去攻击各种各样的网站,这都被挖出来了。

理论上,你跟 Anthropic 交互的所有信息,它想查都查得到。

晚点 :所以当 Anthropic 认为用户可能对他们有威胁时,就能调取和查看用户数据吗?

刘艺 :这需要具体去看不同模型公司的用户条款。据我了解,Anthropic、OpenAI、Google 提供某种 Zero Data Retention(ZDR,零数据保留)机制,承诺在处理完任务后,立即销毁客户输入的提示词和 AI 生成的回复,不存储、不留存,也不用于模型训练。这个功能主要面向符合条件的 API 或企业客户,通常需要申请或额外配置。普通用户在使用 Claude、ChatGPT、Gemini 时,数据留存策略按各自用户协议执行,不等同于严格 ZDR。

比如,模型公司把你的数据稍微改写一下,用作训练,算不算用你的数据呢?

晚点 :也就是说,前沿模型一边让用户付费使用,一边可能使用用户数据继续 scale up?

刘艺 :对。比如,用户在 Claude Code 或 Codex 中纠正模型的回答,这些反馈就是很有价值的奖励信号,可以改善后训练。

蒸馏也是同样的逻辑。当前模型的后训练主要依赖强化学习,关键是奖励信号。模型公司拿到性能更强模型的思维链,相当于拿到了 “大结果”,直接获得了高质量的解题路径。这可以减少盲目探索,让模型更快收敛到比较好的状态,节省时间和算力。

晚点 :美国前沿模型公司防范蒸馏攻击的成功标准是什么?

刘艺 :一是能阻止其他模型公司走捷径训练,保证自身模型的领先优势。二是提高其他模型公司的蒸馏成本、数据采集成本。同时尽量不影响用户的正常使用。

晚点 :能防住吗?

刘艺 :我觉得防不胜防。模型只要让人用,就有泄露的风险。

不过我最近看 OpenAI 在 9 月 10 日正式推出了 Agents API 公测版。不像之前 Responses API,用户给一个输入,大模型给我一个输出,中间加一个思维链。Agents API 的逻辑是用户给任务,直接获得任务的结果。中间思维链、 Agents harness 的过程都隐掉了,相当于卖一整个执行环境。用户不需要再去管非常细节的事,整体的任务执行越来越抽象。在这种场景下,再想蒸馏攻击,成本可能会更高。

反蒸馏的真正动机:占领舆论,保护估值

晚点 :你觉得蒸馏是提升模型能力的最优解吗?似乎后发复制的速度永远也跟不上前沿创新的速度?

刘艺 :我之前有一个观点,2024 年时,短期内模型结构本身的创新是一个护城河。接下来,护城河可能会扩展到算力。再然后,护城河就是基础设施(infrastructure)和能源。我观察目前大概就是按照这个趋势在发展。

晚点 :蒸馏能归属于你这个护城河推演里的哪个部分?

刘艺 :我觉得可以归属到算力。理论上,多试试也能试出来,但可能时间上不允许。

晚点 :反蒸馏最后保护的是什么?

刘艺 :反蒸馏是个伪命题。理论上蒸馏是不可防御的——按照人性,只要我蒸馏你的效率,高过自己构造数据来训练模型的效率,那我一定会先来蒸馏你。

晚点 :你认为美国前沿 AI 公司的反蒸馏是一场注定失败的战役?

刘艺 :对。我的观点就是这样。

晚点 :如果技术上注定失败,美国前沿 AI 公司为什么还这么执着?

刘艺 :他们要保持技术领先。最近 Open AI 称自己使用了约 1 万个 AI 智能体耗时 88 小时完成了七大 “千禧年难题” 之一的数学证明。举个例子,假设 DeepSeek 在今年年底宣布,自己已经把千禧年七大数学难题全部解决了,还在技术报告里写:我只用了 Open AI 1/10 的成本就完成了任务。美国的投资者可能会问,为什么你要这么多钱,还做得没有别人好?Open AI 的估值可能就会跌下来。

所以 Open AI 等美国前沿模型公司反蒸馏行为的本质还是商业逻辑,而不只是科技发展的逻辑:

Anthropic 一是要收数据,建立自己的数据飞轮,二是要把自己的 ARR 做得更好看,为 IPO 做准备。

OpenAI 的逻辑类似。OpenAI 为什么一直给大家发重置卡——那不相当于每按一次就给大家送个钱嘛,就是为了收数据,并且让财务报表变得更好看。

晚点 :9 月 12 日,Anthropic 创始人达里奥(Dario Amodei)发文呼吁全行业放慢前沿 AI 模型的迭代速度。你怎么看?

刘艺 :我认为,他们应该看到了一些瓶颈。瓶颈可能有三个因素:一是数据,二是算力,三是基础设施 / 能源。但具体是哪个瓶颈,我目前不好说,可能三个因素都有。

资本都是逐利的。理论上,如果我能造出 AGI,我能收割全球,我没有理由去停下发展,直接 “冲冲冲” 把 AGI 给实现就好了。他们大概率遇到了瓶颈,才顶着 AI 安全的帽子,出来呼吁大家:AI 太危险了,我们先坐下来讨论怎么限制 AI 的发展。

晚点 :你认为,前沿模型公司反蒸馏的本质原因是什么?

刘艺 :提升对手蒸馏成本,保持自己的领先优势。他们或许判断,中国的模型很快会追上他们的,但没想到更好的方式去保持自己的领先优势,只能加强限制,先占领舆论高地。

从行业朴素共识的角度来讲,蒸馏是一个很大的安全问题,相当于窃取知识产权。但从实用性的角度来说,这本质上是一种 AI 平权。蒸馏是快速平衡市场的一种方式。正因为有很多竞争者,某家模型公司才没法垄断,一家独大,想怎么定价就怎么定价。

晚点 :你提到了蒸馏积极价值的一面,另一方面,蒸馏可能对整个行业,对普通用户带来什么潜在危害吗?

刘艺 :对行业来说,大家的输出风格趋同,模型会继承某几种来自教师模型的失败模式。对用户来说,会有一些隐私泄漏的风险。

晚点 :你认为整体上,包含蒸馏攻防在内的 AI 安全领域处于什么状态,面临什么挑战?

刘艺 :我更关注的是 AI 安全和商业激励之间存在的结构性紧张。

模型公司确实投入了大量资源做安全,但在某些场景下,更严格的安全措施可能影响模型能力、延迟产品发布或者降低用户体验,所以安全目标和竞争目标并不总是完全一致。因此,一个重要的治理问题是,如何让安全投入和公司的商业激励更一致。至少短期内,很难找到一套既能解决安全问题,又不牺牲模型性能的优雅解决方案。

晚点 :你认为蒸馏攻击后续会怎么发展?

刘艺 :攻防还会继续,达到一种动态平衡。可能会有几个流派:一是不要思维链,直接开始蒸,探索能把一个前沿模型蒸成什么样。二是在要思维链的情况下,获取原生思维链。三是自己去合成思维链。

晚点 :为避免隐私数据泄露,你有什么建议给普通用户吗?

刘艺 :别用中转站。在使用某些模型时,能勾选愿不愿意让自己的数据被训练时,别选愿意。其他的你也做不了太多。毕竟人为刀俎,我为鱼肉啊。

 

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup