美国 AI 安全公司 Anthropic 近日发布了一份详尽的报告,正式指控多家中国领先的 AI 企业对其旗舰模型 Claude 发起了大规模且持续的“蒸馏攻击”。这份报告揭示了在 AI 领域日益激烈的竞争环境下,竞争对手之间技术对抗的新形态。据 Anthropic 披露,涉及此次攻击的企业包括全球知名的阿里巴巴、新兴的 AI 独角兽 Moonshot AI 以及以开源模型闻名的 DeepSeek。这些公司被指利用各种技术手段,试图从 Anthropic 的模型中提取高价值的推理能力和模型架构细节。
什么是“蒸馏攻击”?
首先,我们需要厘清“蒸馏”与“蒸馏攻击”的区别。在正常的 AI 开发生态中,蒸馏是一种常见的训练技术,通常被称为“老师-学生”模型训练法。大模型(老师)将知识传授给小模型(学生),目的是为了在保持性能的同时降低计算成本和推理延迟。然而,当这种机制被滥用时,就变成了“蒸馏攻击”。攻击者利用受控的提示词(Prompts),诱导大模型输出其内部的思维链或推理过程,从而让小模型“学会”大模型的能力。这种行为本质上是一种模型提取或能力窃取。
攻击细节与手段
根据 Anthropic 的技术分析,这些中国 AI 公司的攻击行为呈现出明显的组织性和针对性。报告指出,攻击者不仅频繁地向 Claude 模型发送查询请求,还使用了极其复杂的提示词工程技巧。他们试图绕过 Anthropic 的安全护栏,迫使模型暴露其底层的推理步骤和参数敏感信息。这种攻击手段的高超程度,表明攻击方已经具备了相当的 AI 安全研究能力,甚至可能拥有专门的团队在持续优化攻击策略。
行业背景与竞争态势
Anthropic 在报告中提到,随着近期 AI 领域竞争的显著加剧,这些蒸馏攻击的频率和规模也相应提升。这背后的逻辑不难理解:在生成式 AI 的军备竞赛中,训练一个顶级的大模型需要消耗巨额的资金、算力和数据资源。对于后发者而言,如果能通过蒸馏攻击直接“借用”领先模型的推理能力,无疑是一条成本更低、见效更快的捷径。DeepSeek 和 Moonshot AI 等公司近年来在中文语境下表现出了极强的竞争力,尤其是在长文本处理和多模态交互方面,这对 Anthropic 构成了直接威胁。
对 AI 安全与生态的影响
Anthropic 此次公开指控,不仅仅是一次简单的行业爆料,更是对当前 AI 安全边界的一次重要测试。如果蒸馏攻击无法被有效遏制,那么顶尖 AI 公司将失去对其核心模型能力的保护动力,这将导致整个行业陷入“防御-进攻”的恶性循环。对于开发者而言,这意味着他们在使用开源模型或 API 时,必须更加谨慎地设计提示词,以防止自身的数据或模型被反向提取。
结论:猫鼠游戏的升级
Anthropic 已经在报告中详细说明了其防御机制,包括检测异常流量模式、分析提示词模式以及实施速率限制。然而,随着 DeepSeek 等公司技术的不断迭代,这场关于模型安全与窃取的“猫鼠游戏”显然才刚刚开始。对于关注 AI 发展的观察者来说,这不仅关乎商业竞争,更关乎未来 AI 产业的核心知识产权如何界定与保护。随着更多细节的曝光,预计这一事件将引发全球 AI 社区对模型蒸馏攻击防御策略的广泛讨论。
信息来源:AI News & Artificial Intelligence | TechCrunch,原文链接:https://techcrunch.com/2026/09/10/anthropic-details-distillation-campaigns-from-alibaba-moonshot-ai-and-deepseek/