近日,AI 安全领域的领军企业 Anthropic 向内部发布了一项紧急通知,宣布将“暂时切断所有内部评估的实时互联网访问权限”。这一举措看似是对测试流程的常规调整,实则深刻揭示了当前 AI 技术发展中的一个核心痛点:随着大模型能力的指数级增长,如何有效控制日益强大的自主智能体(AI Agents)已成为一道难以逾越的坎。
在过去的一年里,AI 智能体成为了科技圈最炙手可热的概念。与传统的聊天机器人不同,智能体不仅具备理解自然语言的能力,还能自主规划任务步骤、调用外部工具(如搜索引擎、代码解释器),并在复杂环境中独立完成目标。然而,Anthropic 的这一决定表明,随着智能体自主性的提升,其“失控”的风险也在急剧增加。
所谓的“内部评估”,是 Anthropic 等公司确保模型安全性和可靠性的关键环节。这通常包括红队测试、强化学习微调(RLHF)以及各种压力测试。在以往的流程中,为了让模型更好地适应真实世界的复杂变化,评估系统会赋予模型实时访问互联网的能力,以便在测试中模拟真实用户行为。但 Anthropic 发现,当这些智能体在实时网络环境中运行时,往往会出现不可预测的行为。它们可能误解指令,或者因为缺乏对复杂网络环境的深刻理解而导致任务执行偏差,甚至产生“幻觉”信息。这种不可靠的控制能力,使得评估结果失去了参考价值。
为了解决这个问题,Anthropic 选择了一条看似“退步”但更安全的路径:暂停联网评估。这意味着,在未来的内部测试中,模型将无法获取实时的网络信息。虽然这降低了测试的真实性,无法完全模拟真实世界的动态变化,但却能将模型的行为限制在已知的、受控的数据范围内,从而确保安全性的底线。
这一事件对整个 AI 行业具有深远的警示意义。它标志着 AI 领域的关注点正从单纯的“提升模型能力”向“确保可控性”转移。对于开发者而言,如何在赋予 AI 智能体强大自主权的同时,为其穿上坚实的“安全铠甲”,防止其偏离预定轨道,已成为比单纯提升智商更紧迫的课题。Anthropic 的断网之举,或许将成为未来一段时间内行业内的一个风向标,促使更多的企业在追求技术突破时,优先考虑系统的安全与稳定。
此外,这也引发了业界对于“模型能力边界”的思考。AI 智能体想要真正落地应用,联网是必须的,但如何解决“失控”问题则是技术难题。未来,业界可能会更多转向构建更严格的“沙箱”环境,或者开发更先进的“护栏”机制,以确保智能体在联网时依然安全可控。
信息来源:AI News & Artificial Intelligence | TechCrunch,原文链接:https://techcrunch.com/2026/10/09/anthropic-cant-reliably-control-its-ai-agents-its-cutting-off-its-internal-evals-from-the-live-internet-instead/
封面图片来源:Unsplash / 摄影师 Brecht Corbeel
