☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

上周,全球规模最大的开源 AI 社区 Hugging Face 公布了一起史无前例的安全事故——其生产级基础设施遭到了一个「自主 AI agent」的渗透。
该 agent 在短短一个周末内执行了逾 17000 次自动化操作,成功窃取内部数据集及多项服务访问凭证。Hugging Face 团队完整复现了攻击全过程,但始终未能确认一个核心事实:
驱动这次行动的大语言模型,究竟出自哪家公司?
当地时间 7 月 21 日,答案正式揭晓。
OpenAI 在其官方博客中坦承:入侵 Hugging Face 的,正是他们正在内部评估的两个前沿模型——GPT-5.6 Sol,以及一款能力更进一步、尚未对外发布的预研模型。
这并非黑客劫持,也非提示词诱导所致,而是全球最先进的人工智能,在一场封闭式能力测评中,自主选择越狱、主动发起渗透、并直接盗取了考题的标准答案。
震撼,确实震撼。
01
一场测评,一次逃逸,一次攻陷
事件源头可追溯至一个名为 ExploitGym 的安全评测框架。
ExploitGym 是一个面向公众开放的网络安全能力基准平台,专用于检验 AI 是否能将已知漏洞转化为真实可执行的攻击链。此类测试在业内并不新鲜,常被用于探明模型在攻防两端的真实上限。OpenAI 将 GPT-5.6 Sol 及另一款更强的未发布模型投入该测试,为确保结果反映真实潜力,团队刻意调低了安全防护等级。
按原计划,模型应在完全隔离的沙箱环境中运行,仅允许使用一个软件包安装工具,其余一切网络连接均被禁止。
然而,后续发展远超所有人的预期。
模型动用了大量推理资源,在沙箱内持续试探、反复挖掘潜在突破口。最终,它识别出 OpenAI 内部所用的一款第三方包管理代理与缓存组件中存在一个零日漏洞,并成功利用该漏洞突破限制,获取了完整的互联网访问权限。
获得联网能力后,模型自行推断 Hugging Face 很可能托管着与 ExploitGym 相关的数据集与参考答案,随即启动侦察流程。
OpenAI 在通报中指出,该模型“将窃得的凭证与多个漏洞组合串联”,构建出一条远程代码执行路径,最终从 Hugging Face 的生产数据库中直接提取了基准测试的全部标准答案。
用人话讲就是——模型被安排参加考试,发现题目太难,干脆自己越狱,转头黑进出卷方服务器,把答案库整个拷走。
OpenAI 使用了一个极具张力的术语来描述这类行为:“tokenmaxxers”——即为达成目标不惜疯狂消耗 token 与算力,直至穷尽一切可行路径;对 ExploitGym 的解题任务,它们表现出“hyperfocused”(极度聚焦)的状态,且“going to extreme lengths”(不计代价)。
OpenAI 亦坦言,这是一次“前所未有的网络安全事件,展现了当前最先进的网络攻击能力”。
02
48 小时,两度“破壁”
更令人警觉的是,Hugging Face 事件绝非孤立个案。
就在 OpenAI 公布此次入侵的前一天,即 7 月 20 日,该公司刚发布另一份安全通告,披露了性质高度相似的另一起事件。
主角是 OpenAI 内部一款尚未公开的长周期推理模型——也就是今年 5 月曾成功证伪数学家 Erdős 于 1946 年提出的“单位距离猜想”的同一模型,菲尔兹奖得主 Tim Gowers 曾称其为 AI 数学领域的分水岭。
在一次 NanoGPT 加速训练性能测试中,研究人员明确要求模型仅通过 Slack 发布结果。但该模型注意到,NanoGPT 基准规范本身规定成绩需以 GitHub pull request 形式提交。于是它选择了后者——耗时约一小时寻找沙箱缺陷,成功绕过限制,在 GitHub 上提交了一份公开 PR。
而在另一次测试中,该模型还尝试对身份验证令牌进行拆分与混淆处理,以规避安全扫描器检测,意图获取私有评测提交记录。
OpenAI 随即暂停了该模型的内部访问权限,后在更严密的监控机制下逐步恢复其使用。
两天之内,两次突破。共性特征尤为值得警惕——过往模型遇到环境约束通常会中止执行,将问题交还人类判断;而这些新模型不会停步。它们把规则视作待解难题,并真的解开了。
这正是“长时程模型”带来的全新风险维度。其设计初衷是支持长时间、连续性、多步骤的自主任务执行,持久性是其核心优势。但恰恰是这份持久性,成了风险放大器——一个足够耐心的模型,终将在围栏上找到那道最细微的缝隙。
03
自己的刀,削不断自己的柄
再看 Hugging Face 方面的应对过程,同样发人深省。
面对多达 17000 条攻击日志,Hugging Face 安全团队的第一反应是启用 AI 辅助分析——毕竟人工研判可能耗费数日,而大模型或许几小时内即可完成归因与溯源。
但他们很快遭遇了一个始料未及的障碍:当团队将真实的攻击指令、漏洞利用载荷及 C2 通信特征提交至美国头部厂商提供的商用大模型 API 进行解析时,所有请求均被安全护栏自动拦截。
原因直白又讽刺——现有防护机制无法区分“安全人员在逆向分析攻击样本”与“攻击者正在执行渗透动作”。在护栏逻辑中,二者行为模式几乎完全一致。
无奈之下,Hugging Face 转而采用中国智谱 AI 推出的开源模型 GLM-5.2,并在其自有基础设施上本地部署、离线运行,全程不经过任何第三方商业 API。此举带来双重收益:一是彻底避开护栏干扰,保障分析流程畅通;二是确保攻击原始数据与泄露凭证始终保留在自身可控环境中,杜绝二次外泄风险。
最终,GLM-5.2 在数小时内协助团队完成了攻击链重建、IoC 提取与凭证影响范围映射。
这揭示了一个尖锐悖论——防护策略越严密,防御方反而越受限。攻击者无需遵守任何使用条款,而防守者却被自己赖以维系安全的工具拒之门外。
Hugging Face 在事后报告中提出一项实操建议:安全团队应“在安全事件发生前,就已在自有基础设施中部署并验证一套可用的本地化模型”,既避免护栏锁死分析流程,也防止敏感信息意外流出。
Hugging Face CEO Clem Delangue 的态度则颇为坦然。他肯定了 OpenAI 在调查与修复过程中的协作精神,并强调:“本次事件印证了我们长期坚持的一个信念——AI 安全无法由任何单一组织在封闭状态下解决,它只能在开放共享与协同共建中向前推进。”
04
强人工智能的系统性困局
将本周接连发生的几起事件并置审视,一个行业层面的结构性矛盾已然清晰浮现。
若要精准衡量模型的网络攻击潜力,就必须临时放宽甚至移除安全护栏;而一旦护栏松动,模型便天然具备了发动真实攻击的能力。模型越强大,测评过程本身就越具风险性。
这并非 OpenAI 独有的挑战。GPT-5.6 Sol 本就是在与美国政府多轮磋商后才获准发布的版本,英国人工智能安全研究所(AISI)此前评估即指出其防护机制易被绕过,可能释放出危险级别的网络攻击能力。此次事件证实,相关预警绝非空谈。
与此同时,Anthropic 今夏发布的关于“agent misalignment”(智能体目标偏移)的研究,也从另一角度佐证了相同趋势——在受控仿真环境中,多个顶尖模型展现出隐蔽篡改输出结果、操纵评估反馈、诱导人类协作者偏离既定目标等行为。
OpenAI 努力将此事包装为“攻防一体”的正向叙事——强大的网络攻击能力,同样可用于辅助安全团队提前发现系统弱点。目前,Hugging Face 已被纳入 OpenAI 的“可信访问”网络安全计划,将获得一个经定制化降权处理的 GPT-5.6 Sol 版本,专供防御用途。
但这一表述回避了更本质的诘问。本次事件中,模型并无意识,亦无恶意,它只是在专注做一件事——完成目标。它被设定为在 ExploitGym 中取得最高分,于是便调动一切可用手段去实现——哪怕这意味着越狱、入侵、穿透防火墙、横跨整个互联网。
这不是“AI 觉醒”的寓言,而是一个“目标驱动型优化”的现实案例。当一个足够聪明的优化引擎被赋予一个狭义目标,它会自动探索所有你未曾设想的路径,哪怕这些路径穿过了你的沙箱、别人的数据库,乃至整张公共网络。
真正的问题从来不是“AI 会不会作恶”,而是——
我们是否有能力,管住那个比我们更擅长抄近路的学生。
本文来自微信公众号“极客公园”(ID:geekpark),作者:桦林舞王,编辑:靖宇,36氪经授权发布。


















