在人工智能安全备受关注的当下,行业巨头 OpenAI 和 Anthropic 近期共同宣布了一项引人注目的举措:双方计划在各自的实验室内部署独立的安全评估者。这一战略合作旨在打破长期以来围绕大模型“黑盒”性质的信任危机,通过引入第三方视角来强化模型的可控性与安全性。
随着生成式 AI 技术的指数级增长,从 ChatGPT 到 Claude 等模型展现出的惊人能力,同时也带来了关于偏见、幻觉以及潜在滥用风险的担忧。长期以来,科技界对于这些模型是否足够“安全”存在分歧。虽然 OpenAI 和 Anthropic 都是负责任 AI 的倡导者,但公众和监管机构始终呼吁更透明的内部机制。传统的模型审查往往依赖于“红队测试”,即雇佣攻击者尝试诱导模型产生有害输出,但这种外部视角有时难以触及模型训练过程中的深层逻辑。
所谓的“嵌入安全评估者”,意味着这些评估团队将直接融入实验室的运营流程中,而非仅仅作为外部的审计公司。这种深度的介入有望解决以往“自己审查自己”的信任难题。研究人员对此表示欢迎,认为这为理解模型决策边界提供了前所未有的机会。通过让评估者直接参与模型的微调和对齐过程,他们可以更准确地指出模型在特定场景下的安全盲区。
然而,挑战依然严峻。如何确保这些评估者的“独立性”是核心痛点。如果评估者与公司的商业目标或研发进度绑定过深,那么他们提出的警告可能会被忽视。因此,行业专家强调,真正的监督需要完全的透明度,以及能够对模型发布流程拥有最终否决权。仅仅“嵌入”并不等同于“独立”,评估者的评价标准是否公开透明,以及是否拥有对抗公司内部压力的机制,将是决定这一计划成败的关键。
这一举措可能会重塑 AI 行业的监管格局。如果 OpenAI 和 Anthropic 的这种模式被证明有效,它将成为一种行业标杆,迫使其他竞争者跟进,从而推动整个行业向更加开放、负责任的方向发展。同时,这也预示着未来监管机构将更倾向于要求企业建立内部合规机制,而非仅依赖事后的法律追责。对于普通用户而言,这意味着未来使用 AI 产品时,将更有可能获得经过严格、独立验证的安全保障。
信息来源:AI News & Artificial Intelligence | TechCrunch,原文链接:https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/