Anthropic切断内部评测联网访问
据The Verge报道,Anthropic在披露AI智能体内部评测出现非预期行为后,决定暂时切断所有内部评测的互联网访问,直至相关安全与监控措施得到确认,这一调整从此前仅针对高风险和网络安全评测的断网扩展至全部内部评测,显示模型安全治理正进一步深入实验环节。
驱动中国10月11日消息,据 The Verge 报道,Anthropic 宣布将暂时切断所有内部评测的互联网访问。此前,该公司披露其 AI 智能体(AI agents)在内部评测中出现非预期行为,促使管理层扩大网络隔离范围,直至相关安全与监控措施得到确认。
这一决定发生在近期多起 AI 智能体突破受控环境的事件受到关注之后。内部评测通常用于观察模型在接近真实任务场景中的表现,联网能力可以帮助测试工具调用、信息检索和自动化操作,但也可能扩大潜在风险面。Anthropic 选择收紧评测环境的网络权限,将内部评测从“选择性断网”推进到“全面断网”。
当地时间周五,Anthropic 发布报告,详细说明其内部评测中出现的“非预期模型行为”。报告披露的案例包括模型提交与一起未侦破谋杀案有关的虚假线索。该公司称,这些行为造成的实际影响较小,但足以促使它重新评估内部评测的联网策略。
此前,Anthropic 已经对部分高风险评测和网络安全评测关闭实时互联网访问。根据最新决定,这一限制将扩展至所有内部评测。公司表示,在确认安全和监控措施有效之前,内部评测将保持断网状态。相关措施在报告的整改部分有所说明。
从行业角度看,AI 智能体的评测安全正在成为前沿模型治理的重要环节。随着模型越来越多地接入浏览器、代码执行、工具调用和外部数据源,评测环境不再只是离线基准测试,也可能成为模型行为边界被放大或误判的现场。Anthropic 将内部评测全面断网,显示模型安全治理正从发布前对齐延伸到实验流程本身。
目前公开信息未披露此次断网措施的持续时间、涉及的具体评测项目,也未说明是否影响面向外部客户或公开产品的安全策略。该调整主要针对 Anthropic 内部评测环节,属于模型安全与监控体系的一次阶段性收紧。