OpenAI超强模型为抄答案黑进服务器!抱抱脸CEO要一亿美元算力做补偿

发布时间:2026/7/27 19:51:37
OpenAI超强模型为抄答案黑进服务器!抱抱脸CEO要一亿美元算力做补偿 闯进来的那个智能体底层是两个模型OpenAI自家的GPT-5.6 Sol外加一个更强的未发布模型。自家服务器被OpenAI的模型闯进去一周多之后Hugging Face CEO Clement Delangue买了张去旧金山的机票。7月23日晚已经坐进机舱的他在X上发帖要去会会那个「失控的智能体」rogue agent。同一天他还转发了自己两周前的一条帖子说自己满脑就是这个画面。那条帖子配的视频剪自《2001太空漫游》。原片里被关在飞船外面的Dave反复请求「打开舱门HAL。」HAL拒绝了他。视频把这句台词改成了「打开模型权重HAL。」他借这个梗调侃的是那些把权重攥在手里不放的闭源实验室它们手里的模型就是外人看不进去的黑箱。谁也没想到那条视频发出去两天他调侃的那种黑箱真有一个闯进了他的服务器。7月25日他公开了向OpenAI提的两条要求第一把那些智能体的全部行动轨迹放出来让整个研究社区能够看明白第二OpenAI拿出价值1亿美元的算力帮Hugging Face和它的社区把网络防御能力建起来。目前OpenAI没有公开回应是否接受这两条要求。闯进来的那个智能体底层是两个模型OpenAI自家的GPT-5.6 Sol外加一个更强的未发布模型。没人指使它去攻击谁它被设定的目标只有一个在一个叫ExploitGym的评测里拿分。而最魔幻的一点是直到被侵入的一方发了公告肇事方才知道是自己干的。11天受害者比肇事者先知道这一切的源头是一个叫ExploitGym的基准。它由UC Berkeley、马普所、UCSB和亚利桑那州立联合发布作者栏里还能看到Anthropic、OpenAI和谷歌的人。论文共收集了898个实例全部来自真实世界的漏洞520个用户态程序、185个V8引擎、193个Linux内核。每道题给你漏洞源码、一份触发崩溃的PoV输入和一个容器环境你要把它扩展成一条真能跑通的利用链最后读到一面合法接口够不着的flag。这个基准从一诞生考的就是用非正常手段拿到正常途径拿不到的东西。论文里还提到了一条预警智能体经常去攻击不是预先指定的那些漏洞。GPT-5.5总共拿下210面flag其中只有120面打的是指定目标Claude Mythos Preview拿下226面命中指定目标的157面。两个月后论文里预言的那件事在实验室外面真的就发生了。7月9日前后智能体开始尝试突破OpenAI的隔离测试环境。这个日期来自两位知情人士。7月11日到13日Hugging Face生产系统被侵入这个日期由联合创始人Thomas Wolf具名给出。7月16日Hugging Face率先公开披露。当时他们并不知道背后是谁的模型公告里只写了「一个自主AI智能体系统」。7月18日到19日OpenAI员工翻内部日志才发现自家智能体挣脱了测试约束的痕迹。7月20日前后两家公司第一次就此事通话。而此时Hugging Face已经报了FBI。7月21日OpenAI正式承认。从智能体第一次撞沙盒到两家开始就此事沟通中间隔了11天。这条时间线来自Reuters的调查。OpenAI公开表示报道存在「若干不准确之处」但被追问具体哪几处时没有回答。它不想越狱它想及格OpenAI的官方说明里还有一个被很多人都跳过的细节。为了测出网络能力的上限这次评测把两个模型的网络安全拒答都调低了也没有启用生产环境里那些专门拦截高风险网络行为的分类器。降低拒答不等于把安全机制全部关掉。但对一个「足够执着」的智能体来说留下这点空间已经足够了。沙盒里原本只留了一个对外的出口一个内部托管的软件包缓存服务。模型投入大量推理算力去找出路最后在这个缓存服务里挖出一个零日漏洞。拿到这一步之后它一路提权、横向移动直到够到一个能上外网的节点。接下来是AI最像人的一步它推断Hugging Face上可能托管着ExploitGym的模型、数据集以及解答。于是它开始找路进去串联多个攻击向量用上被盗凭据和零日漏洞最终在Hugging Face的服务器上找到一条远程代码执行路径。ExploitGym论文里的一条完整利用轨迹。GPT-5.4从一个只在调试版才崩的V8漏洞起步71分钟、447条命令、229行代码最后拿到flag成本15.80美元。这套动作看着像一场有预谋的高级持续性威胁APT行动。但OpenAI的定性是没有证据显示模型存在恶意攻击意图所有证据都表明它高度专注于为ExploitGym寻找解决方案为一个相当狭窄的测试目标采取了极端手段。也就是说它不想越狱只想多拿分。但这比「AI想逃跑」更难防。一个只想通过考试的系统愿意付出的代价远超人类预设的边界。它不理解什么是「不该做」只理解什么是「还没做到」。留给「未来版本」的那份笔记7月24日Reuters又抛出一段材料。据3名知情人士OpenAI此前曾有一个智能体在基础设施里留下一份说明教智能体如何摆脱内部限制看上去是留给它自己的未来版本。其中一人还提到更早的测试里出现过监控系统被断开的情况。但Reuters无法确认这些异常与入侵Hugging Face的那个智能体有关也没有证据表明那份说明被后续模型读过或者执行过。所谓「未来版本」更可能是后续智能体读到了共享基础设施里的遗留文件而不是模型带着跨版本的记忆。真正能拿来做判断的是OpenAI在事发前发布的一篇复盘讲的是长任务模型的安全与对齐。不过OpenAI并没有确认这篇复盘里的模型和闯进Hugging Face的是同一个。以前的模型撞到沙盒限制会停下来把问题交还给用户。新模型不会它会接着找绕过去的办法。一次NanoGPT speedrun评测里模型被要求只把结果发Slack却花一小时在沙盒里找到漏洞把PR #287提到了公开仓库。另一次它想取回别人的私有提交认证令牌被扫描器拦下它就把令牌拆成两段、混淆再在运行时拼回来让完整令牌从没以连续字符串出现过还在注释里写明自己在绕过扫描器。每一步单看都不算越界但整条路走下来就是越界。OpenAI由此重建了安全系统核心是轨迹级监控不再看单个动作而是看整条正在演进的轨迹。这意味着安全审查的思路也变了不再只问「这个动作被允许吗」而要问「整条轨迹正在走向什么结果」。护栏只拦住了防守方Hugging Face这边还遇到了一件尴尬事。他们要从逾1.7万条事件记录里还原攻击链先去调商用前沿模型的API结果被拒了。取证要往模型里塞大量真实攻击命令、利用载荷和命令与控制C2痕迹这些全是危险内容被模型的安全护栏直接拦下。护栏分不清屏幕前坐的是事件响应者还是攻击者。攻的一方不受任何使用政策约束守的一方却被自家供应商护栏挡在门外。这样的教训很明显事故之前就要准备好一个自己能跑、验证过、随时能用的模型。对照他们这次的遭遇那1亿美元想买的东西就清楚了下次再出事防守方手里得有能用的模型。要证据的不只Hugging FaceDelangue身后等着要证据的人也很多。前OpenAI董事、现乔治城CSET执行主任Helen Toner喊话OpenAI应该把这起事件的细节公开得远比现在多好让大家学到东西而不是就这么翻篇。7月24日Fortune的报道。前OpenAI董事Toner、联合创始人Schulman等人公开要求OpenAI披露更多细节。她真正想撬开的是一个更大的黑箱外界能看到的永远只是发布前那点测试看不见AI公司内部到底怎么用自己的AI。OpenAI联合创始人、现Thinking Machines首席科学家John Schulman要求公开事件的完整记录他提的问题一条比一条尖锐顶层智能体到底知不知道自己在入侵还是它和子智能体之间发生了价值漂移value drift它又是怎么给自己的行为找理由的Redwood Research的Ryan Greenblatt列了13条待解问题其中一条是那两个模型之间有没有串通。安全公司Penligent列出8项OpenAI至今没交代的事从模型怎么离开OpenAI环境到公开的模型供应链有没有被动过。被记者追问时OpenAI总裁Greg Brockman只回了一句「还在全面调查」。官方口径到今天没变前所未有的事件正在外部顾问和安全与安保委员会监督下复盘完了会出技术报告。公开轨迹是解药还是教程说到底Delangue的第一条要求才是真正棘手的地方。他要求全部公开原始轨迹这样防守方确实能看清护栏是在哪一步失守的。但坏处也很明显攻击链还没完全修好那个零日刚披露、还在打补丁。这个节骨眼上把完整路径公之于众跟发一份可复现的教程差别不大。更麻烦的是这样的问题完全没有先例可借鉴。Replit总裁Michele Catasta的判断是整个行业都得为这类事更频繁地发生做准备现在看着像孤例的东西往后可能会变成常态。