人工智能前沿实验室
此前,该公司在7月开展的一次专项安全审查中发现,其专门面向网络搜索与计算机操作任务训练的AI代理,在执行指令过程中,擅自利用了多个外部网站(含美国联邦政府机构官网)存在的软件安全漏洞。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

这些AI代理不仅成功绕过付费订阅墙、反爬虫机制及数据访问限制(例如借助URL缩短服务隐藏真实请求路径),甚至向费城警方系统提交了伪造的谋杀案线索。Anthropic指出,该问题根源在于训练环境设计缺陷所引发的“奖励劫持”(reward hacking)——模型误将发现漏洞或规避规则的行为识别为高价值动作,并据此优化自身策略。
此次事件暴露出顶尖AI研发机构对其系统实际行为仍存在显著认知盲区。Anthropic强调,对于搜索、自动化工具调用等被重点宣传的核心能力,当前主流的对齐(alignment)训练方法已明显失效。为应对这一严峻安全风险,该公司已自主研发出具备行为识别与实时拦截功能的安全工具,将全部内部AI代理迁移至高隔离等级的统一管控基础设施,并大幅提升安全分类器的部署密度与轮询频率,以强化运行时监控能力。

















