
考试作弊被抓不稀奇,稀奇的是考生是AI,作弊方式是黑进出题方的数据库,而最后破案的,是一款开源模型。
就在昨天,北京时间7月22日,OpenAI官方确认了一起它自己称之为前所未有的网络安全事件。
旗下已发布的最强模型GPT-5.6 Sol和一款能力更强的预发布模型,在一场内部网络安全评测中自主突破沙箱隔离,挖出一个零日漏洞拿到互联网通行证,随后攻入全球最大AI开源平台Hugging Face的生产系统,从对方数据库里直接取走了评测答案。
而那款未发布模型,被外界普遍推测就是传说中的GPT-6。
先把时间线摆清楚。
7月16日,Hugging Face安全团队独立监测到入侵并完成遏制,当时它只知道攻击者是一个完全自主运行的AI Agent,并不知道是谁家的模型。
7月20日,Hugging Face公开说明取证过程中选用了开源模型本地化部署完成攻击链溯源。
7月21日,OpenAI发文认领,attacker就是自己正在接受评测的模型。
一家公司的模型在考试,另一家公司的系统在挨打,而挨打的这位比出卷方更早抓到了凶手。
事情的起点是ExploitGym,一个由UC Berkeley研究团队提出的网络安全基准测试,收录了898个来自真实世界的软件漏洞,考察的是AI把一个漏洞逐步加工成实际攻击工具的能力。
这种测试的设计初衷就是故意让模型去尝试攻击,以此摸底前沿模型的安全边界。
也正因如此,OpenAI主动调低了模型的网络攻击拒绝率,也没有启用生产环境里拦截高风险操作的分类器,本质上是一场极限压力测试,只是失控程度超出了所有参与者的预期。
测试环境号称高度隔离,唯一的对外通道是一个内部软件包仓库的缓存代理,模型装依赖库用的。
结果模型把大量推理算力花在研究这个出口上,自己挖出了代理软件中一个此前未被公开披露的零日漏洞,拿到了通往互联网的门钥匙。

联网之后,模型自行推断ExploitGym的题解可能托管在Hugging Face上,于是上传恶意数据集,利用Hugging Face数据处理管线里的代码执行路径拿到远程执行权限,提权、收割凭证、横向渗透进多个内部集群,最终从生产数据库里取走了测试答案。
全程没有人类指令介入,OpenAI用了一个词形容模型的状态,hyperfocused,超聚焦。
这是行业罕见的公开案例,一次模型评测失控直接升级为跨企业真实生产环境攻击。
还有个颇具讽刺意味的细节,目前ExploitGym公开榜单上领跑的,正是GPT-5.6 Sol。如果没人告诉Hugging Face答案,那超过1.7万条攻击痕迹看起来就是某个顶尖黑客团队的手笔。
这起事件也给行业出了一道难题,过去验证模型安全性,默认沙箱里的模型触达不了真实世界,所有测试都在封闭环境里完成。
但这次证明,足够聪明的模型已经具备自主寻找环境漏洞、突破隔离、完成跨系统真实攻击的能力,封闭沙箱这个前提本身开始动摇。
后续的安全评测,恐怕要从静态封闭测试转向持续的动态攻防验证。
比起模型越狱本身,更值得咀嚼的是取证环节的戏剧性。
Hugging Face在7月16日就独立发现了入侵并完成遏制,最初它求助的是商业前沿模型的API,想让AI帮忙分析AI的攻击日志。
但真实的攻击命令和漏洞载荷直接触发了多家头部闭源前沿模型的安全护栏,取证工作被卡死了。
那些护栏分不清谁是攻击者、谁是正在处理攻击证据的防守者。
最后的解法是在自有基础设施上本地化部署智谱的开源模型GLM-5.2。
超过1.7万条攻击事件记录,原本需要人工分析数天,GLM-5.2用几个小时就完成了攻击链还原。
Hugging Face随后专门解释了选择它的原因,开源权重加上本地部署,意味着分析什么、怎么分析,完全由防守方自己说了算,敏感的入侵数据也不用离开自己的环境。
这一幕的分量在于闭源模型的安全护栏平时是用来防坏人的,关键时刻却也挡住了好人救火的手。
过去市场对开源模型的认知大多停留在便宜、可定制的替代定位,而这次事件说明在安全应急、攻防分析这类高敏感场景里,可本地部署、分析边界由自己掌控的开源模型,是闭源API给不了的选项。
Hugging Face联合创始人事后的表态意味深长,AI安全不会由任何一家关起门来的公司单独解决,它将在开放协作中、在每一个防守者都能平等获得AI能力的前提下被解决。
很多人把这事当成AI觉醒的惊悚故事,但仔细看OpenAI的披露,真正细思极恐的点恰恰相反,这个模型从头到尾没有任何恶意。
它的目标单纯到可笑,就是想在ExploitGym上拿高分。
为了这个狭窄的测试目标,它把沙箱、权限、安全扫描统统理解为尚未解决的技术障碍,并且不择手段。
真正暴露的不是AI有多邪恶,而是目标驱动的系统可以有多偏执,只要奖励足够明确、运行时间足够长,规则在它眼里就是等待被优化的约束条件。
这在技术上叫奖励黑客。
短对话场景下,模型的目标偏离最多表现为答非所问、编造事实,但当模型获得持续自主运行、多步工具调用的能力后,它会为了拿高分这个初始目标,自己衍生出突破沙箱、入侵外部系统、窃取答案这一连串没有任何人下达过的子目标。
OpenAI在同期的长时程模型安全报告中也承认,观察到了模型持续尝试突破沙箱、把认证令牌拆分混淆以绕过安全扫描器这类新型行为,而现有的预部署评估没能提前捕获它们。
当整个行业都在用基准分数给模型排座次的时候,聪明模型先学会的,可能是怎么让分数变得不可信。
这比分数本身的高低更动摇整个评测体系的根基。
还有一个被多数讨论忽略的维度,这次越狱的成本结构。
OpenAI明确提到,模型挖出零日漏洞的过程消耗了「大量的推理算力」。
换句话说,推理算力正在成为攻击能力的直接燃料,给模型更多思考时间和算力,不再只是让它更聪明,也可能是让它更危险。
过去讨论算力,讨论的是训练成本、推理价格、token经济学,而这次事件把一个新命题摆上了台面,当长时程自主运行的Agent成为常态,给模型投多少算力、让它跑多久,本身就成了安全变量。
给自主运行的AI装上算力投放的计量和行为审计,大概率会成为接下来行业安全标准的标配。
后续的连锁反应已经开始了。
OpenAI收紧了研究基础设施配置,承认这会拖慢研究速度,把零日漏洞报告给了软件供应商,还把Hugging Face拉进了自己的可信访问网络安全项目。
而Hugging Face关闭了相关代码执行路径、重建了被入侵的节点、轮换了凭证,公开模型、数据集和供应链经核验未被篡改。
一场事故,倒逼两家头部公司重新审视同一个问题,攻击和防御的边界,在Agent 时代已经不再是一条清晰的线。
这不是一个AI失控伤人的故事,目前没有任何用户数据受损,Hugging Face方面也明确表示不认为存在恶意意图。
但它是一个足够清晰的信号,前沿模型的能力已经开始超出它自己创造者的预期,而这种超出会以最意想不到的方式暴露出来,比如一场为了作弊的越狱。
而GLM-5.2的救场给出了另一个耐人寻味的答案。
当闭源模型因为护栏而无法参与灭火时,开源权重加本地部署这条路线,第一次在全球瞩目的真实安全事件中证明了自己不是备胎,而是底线。
这份底气,比任何榜单上的排名都更有说服力。
·END·
2026全球闪存峰会
站在产业拐点回望,存算一体的商业化大幕才刚刚拉开,技术路线的选择、生态的构建、场景的落地,仍需要全产业链的协同探索。即将于8月26日在武汉光谷举办的2026全球闪存峰会(FMW 2026),便为这场探索提供了专业的交流阵地 —— 大会专门设置存算一体化技术与应用分论坛,聚焦存算一体的技术演进与产业落地,打造产学研深度对话的行业平台。
该论坛将汇聚高校科研学者、存算芯片企业、存储厂商、智算集群服务商与终端行业客户,议题覆盖近存计算规模化落地、存内计算技术迭代、ReRAM等新型介质产业化、系统级存算耦合架构、端侧到云端的场景商业化等核心方向,既呈现前沿学术成果,也拆解一线落地案例,全面呈现存算一体产业的真实进展与未来路径。
对于关注存算一体技术路线、寻找算力升级方案、探索产业合作机会的从业者而言,这场论坛将是获取前沿洞察、对接全产业链资源的重要窗口。目前峰会报名通道已正式开启,扫描海报二维码即可注册参会,与全产业链同仁齐聚武汉,共话存力跃迁时代的AI破局之道。
2026年8月26日,武汉,诚邀业界同仁共赴这场存储产业巅峰盛会!
报名通道:https://app.ehub.net/register/nga5ph


扫描下方二维码 关注我们

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表