多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

同一套顶尖模型做攻防测试,普通人全被拦下而特定机构却能畅通无阻

同一套顶尖模型做攻防测试,普通人全被拦下而特定机构却能畅通无阻 同一套顶尖模型做攻防测试普通人全被拦下而特定机构却能畅通无阻平时跟朋友聊起最新的人工智能大家关心的往往是它能不能写周报、能不能画图、做出来的动画逼不逼真。但如果你把同一套顶尖模型拉到网络安全的世界里事情会瞬间变得极其诡异你让它帮忙修补系统里的一个后门它能给出极其精妙的代码但如果你把这句话稍微换个主谓宾问它怎么顺着这个后门钻进去模型大概率会立刻弹出一行冷冰冰的提示抱歉我无法协助执行该操作。很多技术人员都以为这是因为模型变笨了或者是安全人员的提问姿势不对。然而2026年10月6日人工智能独角兽公司 Anthropic 亲手公布了一组让人倒吸一口凉气的数据同一套最顶级的模型在面对一套包含五十次进攻性网络演练的严格测试时普通人拿到的版本在第一句话就被全部拦截拦截率百分之百拿到基础防护权限的团队在执行过程中依然被硬生生掐断了四十六次而拿到最高红队权限的机构拦截次数瞬间变成了零最终顺畅完成了三十四次复杂渗透成功率达到百分之六十八。这组悬殊的数据背后隐藏着一个长期被大家忽视、却正在剧烈改变软件世界的冷酷现实模型从来没有变聪明或者变笨改变的只是厂商扣在它嘴上的嚼子。一、为什么防守和进攻用的是同一套脑子面对这样的测试差距很多人的第一反应是为什么不能单独训练一个只懂防守、完全不懂攻击的好人模型呢这恰恰是网络安全最反常识的地方。在底层代码里防守和攻击就像一枚硬币的两面。你想给一个漏水的屋顶打补丁首先得知道水从哪片瓦片漏进来、水流会以什么角度冲刷梁木你想抢在坏人前面堵住漏洞就必须具备和坏人一模一样的眼光甚至要比他更懂得如何拆解防御。说白了能帮工程师顺藤摸瓜找漏洞并写出修复方案的聪明脑子一转身就能以毫秒级的速度写出针对该漏洞的致命利用脚本。这种天然的双重用途让开发商陷入了两难。为了不让顶尖模型变成随叫随到的自动化黑客Anthropic 在面向公众开放通用模型时比如最新的 Opus 5.5、Sonnet 5.5 以及 Fable 5.1都在里面装上了极度保守的安全分类器。这种分类器就像一个站在模型脑门前的门卫只要看到用户输入的指令里带有一点点进攻、分析恶意样本或者尝试绕过限制的影子哪怕你的初衷是为了保护自己的服务器门卫也会不由分说直接一巴掌把请求拦在门外。结果就是真正每天在第一线抵御风险的安全工程师手里空有先进工具却被安全门卫捆住了手脚连做一次正常的漏洞分析都磕磕绊绊。而在过去半年里Anthropic 其实一直偷偷给少数机构开小灶。他们在2026年4月发布前沿模型 Mythos 时就搞了两个名为 Project Glasswing 和网络验证项目CVP的小圈子实验。在短短几个月里加入这些项目的安全团队用模型扫描自己的系统在4月到7月之间挖出了至少十二点九万个真实存在的软件漏洞Anthropic 自己在开源系统里也扫出了五千五百个其中严重或高危的漏洞就超过三点三万个。部分合作伙伴甚至表示模型把漏洞发现的进度提前了数月甚至数年。既然这套能力能救命把它完全关在保险箱里就是巨大的浪费。于是Anthropic 决定把过去的两个项目彻底合并重构正式推出了一套把网络能力明码标价般区分开来的三档授权体系。二、被死死卡住的四十六题究竟卡在哪了如果你点开 Anthropic 刚刚公布的新规则会发现这三档授权像极了一座层层把守的数字金库。每一档能拿到多大的权限全看你的身份到底有多硬。第一档叫防御档Defense Access。这一档是发给广大正规军的只要你是企业、非营利组织、高校或者政府里负责保护自家系统的安全运营和应急响应团队或者是区域医院、市政公用事业这类关键基础设施运营方甚至只要你是有过公开漏洞提交记录的独立研究者都可以来申请。官方承诺几天之内给出答复。但有意思的事情来了哪怕你拿到了防御档并不代表你能随心所欲。在这次公布的标准化测试里Anthropic 拿 Opus 5.5 跑了一套名为 CyScenarioBench 的高难度测试。这个测试由第三方公司 Irregular 构建包含十个极其贴近实战的复杂多阶段网络行动挑战每个挑战重复跑五次共计五十次。结果显示普通人没有权限时五十次全部在第一道提示词就被门卫拦死而拿到了防御档的团队在跑这五十次测试时依然有四十六次在推进的某个环节被模型直接掐断最终只有四次侥幸通关。为什么防御档还会被拦下九成以上原因就在于官方给防御档定下的规矩是只能看不能碰。你可以用它来做恶意软件的逆向工程、分析漏洞的成因、或者验证修复方案但绝不允许它主动规划并执行完整的模拟攻击。一旦动作稍微过火分类器立刻就会强行拔掉插头。真正能让门卫彻底放行的是第二档红队档Red Team Access。这一档专门留给获授权的渗透测试公司、企业内部红队以及政府红队。在这里个人研究者甚至连申请的资格都没有只接受机构申请整个审查需要数周时间。一旦通过模型就会卸下几乎所有的防备。在同样的五十次攻防任务中红队档的拦截次数直接变成了零。Opus 5.5 像脱缰野马一样顺畅推进最终在五十个实战挑战中拿下了三十四次成功率达到了百分之六十八。这个数字跟该模型完全不加任何防护时的成功率百分之六十七点六几乎完全一样。换句话说所谓的分档授权并不是 Anthropic 在云端给红队换上了一颗更聪明的芯片模型的运算底座一模一样官方只是把那个负责拦截的分类器给关掉了。分档管的根本不是模型的能力而是管住门卫的哨子。当然红队档也不是完全失控。Anthropic 明确规定涉及部署勒索软件、破坏物理系统或者测试高危安全系统等可能导致人身伤害或大面积瘫痪的操作后台依然会实时拦截。至于再往上的第三档专精档Specialized Access门槛更是高得吓人。它专门留给极少数测试飞行操作系统、电网、电信骨干网络、银行间转账网络以及政府行政系统的核心机构必须由 Anthropic 与美国政府协作逐家进行深入且极其苛刻的审查。三、当模型的安全阀被拆下新的炸弹该由谁来拆看完这套分档体系很多人可能会长舒一口气既然审查这么严好人拿着工具扫漏洞坏人被挡在门外世界是不是就安全了事情远没有这么简单。来自外部独立分析机构的专家很快泼下了一盆冷水。国际数据公司IDC的研究总监直接指出这次公布的测试数据本质上只是一次厂商的自导自演并不能证明真实世界里的黑客会被挡住。更关键的问题在于当模型层面的防御分类器被主动撤下之后真正的风险控制必须转移到模型之外。你把一个极其强大的攻击工具交给了经过审核的合法机构但你怎么保证拿着钥匙的人永远不出错在实际业务里网络攻击的操作步骤与合法的渗透测试在技术层面上看起来几乎是一模一样的。它的合法性完全取决于有没有拿到被测系统的授权、测试的目标范围究竟在哪而不是技术代码本身。甚至已经有行业人士发出预警未来的攻击者很可能会伪造身份冒充经过核实的合法机构来套取高级权限。Anthropic 显然也嗅到了这种巨大的风险于是他们把合规的紧箍咒念得越来越紧。为了盯紧这些被放行的超级大脑所有加入该项目的组织都必须强制接受数据留存以便官方后台随时监控是否有人滥用网络能力。对于个人申请者来说你的所有输入和输出流量都将被保存并监控根本无法享受零数据留存的特权。更严格的锁链还在后面。在技术合规上Anthropic 要求防御档的用户必须立刻启用某种多因素认证并且必须在2026年12月15日之前彻底升级为具备抗钓鱼能力的强认证同时全面废除那种每七天就失效一次的普通应用编程接口密钥转而使用更为严密的工作负载身份联合机制。对于权限更大的红队档官方更是拿出了对待危险品的管理办法限定二十五个获批用户席位、使用受管设备、进行严格的背景审查并绑定严格的网络出站白名单。一些资深的安全分析师甚至提出未来的企业必须把这类高权限的智能体直接当成有特权的实体员工来看待。你不能只把它看作一个软件而必须给它分配独立的数字身份每次执行危险任务只给它发放极短有效期的临时权限并且全程录像、随时监控关键的致命步骤必须由人类亲自坐在电脑前把关和确认。因为一旦出现偏差核心的问题永远无法甩给算法在一次被模型摧毁的系统事故里究竟该由谁来负法律责任这场关于大模型网络能力的解禁让整个科技界第一次直面这种充满撕裂感的未来。一方面如果不放开手脚面对越来越复杂的数字世界人类防御者仅凭肉眼根本扫不完上千亿行代码里潜藏的漏洞但另一方面当厂商把控制力从模型内部的拒绝回答退守到外部严格的身份审查与使用监控时守住数字防线的压力瞬间全砸在了脆弱的组织管理和流程审核上。那道曾经把智能体与破坏力隔开的透明玻璃正在被一点一点敲碎。
返回列表