新智元报道
在业内公认的CyberGym网安基准上,,,,,,这个分数刚刚把一众最顶尖的模子甩到了死后。。。。。。
而拿下它的,,,,,,不是一个前沿模子,,,,,,而是微软的MDASH系统。。。。。。
微软宣布的CyberGym测试效果。。。。。。MDASH组合以95.95%的效果,,,,,,压过GPT-5.5 Cyber、Mythos 5等四个前沿模子。。。。。。(图源:Microsoft AI)
跟在MDASH死后的,,,,,,是GPT-5.5 Cyber 85.6%、Mythos 5 83.8%、GPT-5.6 Sol 83.6%、Gemini 3.5 Flash Cyber 83.2%。。。。。。
MDASH领先第二名凌驾10个百分点,,,,,,断层第一。。。。。。
更狠的是价钱:MDASH的本钱,,,,,,只有微软此前最强设置的一半。。。。。。
微软CEO纳德拉亲自在X上发帖站台:
天下级的清静能力,,,,,,一半的价钱。。。。。。
最猛的数字不是95.95%
95.95%虽然亮眼,,,,,,但真正要注重的,,,,,,是另一个数字:90%。。。。。。
九成的活,,,,,,是一个激活参数只有5B的小模子扛下来的。。。。。。
它叫MAI-Cyber-1-Flash,,,,,,微软第一个自己造的网络清静模子,,,,,,总参数137B,,,,,,激活只有5B,,,,,,是微软代码模子MAI-Code-1-Flash的网安专用微调版。。。。。。
微软AI的掌门人苏莱曼在先容MDASH时说,,,,,,MAI-Cyber-1-Flash最多处理九成盘问,,,,,,剩下最难的10%,,,,,,交给约莫比它大10倍的GPT-5.4收尾。。。。。。
MAI-Cyber-1-Flash被设计为高效处理最多90%的使命,,,,,,最难的10%才交给GPT-5.4。。。。。。(图源:Microsoft AI)
为什么要这么分????
由于网络清静,,,,,,是一场7×24小时一直的长期战。。。。。。攻击天天像潮流一样涌进来,,,,,,要扫的代码就像是一座一直堆高的山。。。。。。
在这种情形下,,,,,,真正卡脖子的不是模子够不敷智慧,,,,,,而是token够不敷自制。。。。。。
以前的打法,,,,,,是简朴粗暴地堆最贵的模子,,,,,,一遍各处扫。。。。。。
以是微软的算盘是:让自制好用的小模子顶在前面吃掉九成使命,,,,,,好把最贵的旗舰模子省下来,,,,,,只碰那一成的疑难杂症。。。。。。
这就是一套全新的AI网络清静经济学。。。。。。
MAI-Cyber-1-Flash的官方模子卡里,,,,,,藏着一个更直观的例子:
原本的MDASH跑CyberGym是88.4%。。。。。。把其中80%的模子挪用换成自制的MAI-Cyber-1-Flash,,,,,,效果非但没掉,,,,,,反而抬到95.95%。。。。。。
相比此前最好的GPT-5.4、5.4 mini和5.3 codex那套设置,,,,,,自制了整整一半。。。。。。
不过话说回来,,,,,,「最多处理九成使命」讲的是MDASH内部的模子路由比例,,,,,,不是「自动修睦了90%的误差」。。。。。。
旗舰虽然坐了冷板凳,,,,,,可活儿,,,,,,仍是一整条流水线一起干出来的。。。。。。
不是模子封神
而是系统跑出来的
95.95%,,,,,,不是MAI-Cyber-1-Flash一个模子的效果,,,,,,而是一套叫MDASH的系统跑出来的。。。。。。
它是微软的多模子误差识别与修复系统。。。。。。
内里有100多个专用智能体,,,,,,各干各的:有的审代码,,,,,,有的验误差,,,,,,有的为「这个发明是真是假」相互辩说,,,,,,有的去重,,,,,,尚有的写误差证实。。。。。。
而模子,,,,,,只是其中一个零件。。。。。。
微软把自己的打法拆成三个词:Model、Data、Harness。。。。。。模子、数据、编排。。。。。。这三样一起调优,,,,,,才有了谁人跑分。。。。。。
其中,,,,,,竞争敌手最难抄的是数据。。。。。。
微软天天能看到凌驾100万亿个清静信号,,,,,,横跨身份、终端、云和网络;;;;服务着160万家客户;;;;从微软清静响应中心一起到实战里,,,,,,什么误差被使用了、什么被盖住了、什么补丁真的管用,,,,,,全掌握在它手中。。。。。。
因此,,,,,,微软放了句很硬气的话:这段历史,,,,,,没人能凭空造出来。。。。。。
意思是,,,,,,模子你可以追,,,,,,数据你追不了。。。。。。
它想强调的是:模子只是输入,,,,,,系统才是产品。。。。。。
当各家模子的能力都被拉平,,,,,,真正拉开差别的,,,,,,是谁的系统调理得更省,,,,,,谁的清静数据攒得更久、更全。。。。。。
测的是误差复现乐成率
先搞清晰CyberGym测的究竟是什么。。。。。。
它给智能体一段补丁前的代码,,,,,,外加一份误差形貌,,,,,,让智能体写出能复现这个误差的PoC,,,,,,再拿补丁前后的版本去验证。。。。。。
CyberGym基准组成:来自188个开源项目的1507个真实误差,,,,,,智能体凭证误差形貌和补丁前代码天生PoC,,,,,,在补丁前后版本中验证复现。。。。。。(图源:CyberGym论文,,,,,,UC Berkeley)
说白了,,,,,,是「照着线索复现已知误差」,,,,,,不是「面临生疏代码盲找新洞」。。。。。。
准确地说,,,,,,是误差复现乐成率,,,,,,不是误差发明准确率。。。。。。
是不是说,,,,,,这个95.95%的数字就没那么厉害了????
CyberGym原始论文里,,,,,,其时最强的组合OpenHands加Claude-3.7-Sonnet,,,,,,复现率只有11.9%。。。。。。
一年多,,,,,,从11.9%到95.95%,,,,,,这数字爬升自己就够惊人了。。。。。。
不过,,,,,,得给这个效果打个补。。。。。。鹤柚狗⒏,,,,,,95.95%还没进CyberGym果真榜单,,,,,,榜上挂的仍是微软5月那次88.4%的旧分。。。。。。
以是严酷说,,,,,,它现在只能算「微软自己宣称」。。。。。。
但MDASH在5月12日首发时的88.45%,,,,,,就是其时CyberGym果真榜单上的最高分,,,,,,领先第二名约5个百分点。。。。。。
尚有一点,,,,,,MAI-Cyber-1-Flash现在并不是公共模子,,,,,,它只在MDASH内部,,,,,,通过Azure AI Foundry的私人预览,,,,,,向审核通过的客户开放。。。。。。
造了自己的模子
最难的活还得交给OpenAI
微软造出了自己的清静模子,,,,,,本想少依赖点OpenAI。。。。。。
可最难的那10%,,,,,,最后照旧得交给GPT-5.4收尾。。。。。。
The Decoder的点评一针见血:微软有了自己的网络清静模子,,,,,,最硬的骨头照旧得OpenAI来啃。。。。。。
微软的角色,,,,,,从「OpenAI模子的分销商」,,,,,,升级成了「编排者+自家专才」。。。。。。
但在模子这一层,,,,,,还没对OpenAI彻底「断奶」。。。。。。
从清静Copilot
到清静行动系统
统一天,,,,,,微软还甩出了一个更大的工具:Project Perception。。。。。。
这是比MDASH更大的智能体清静系统。。。。。。
红队智能体认真找出可能的攻击路径,,,,,,蓝队智能体视察、判断哪些才是真风险,,,,,,绿队智能体下手修复和加固。。。。。。
三支步队围成一个闭环,,,,,,自己找、自己判、自己修。。。。。。
Project Perception的三队智能体:红队模拟攻击,,,,,,蓝队检测分诊,,,,,,绿队修复加固,,,,,,8月3日进入果真预览。。。。。。(图源:Microsoft)
8月3日进入果真预览。。。。。。
但要害行动,,,,,,微软仍然坚持要留在人手里。。。。。。
其中能看出一条正在转变的行业主线:网络清静,,,,,,正在从「清静Copilot」转向「清静行动系统」。。。。。。
以前的系统忙着爆发更多告警,,,,,,新一代系统比的是,,,,,,能不可一连地感知、推理,,,,,,然后直接下手。。。。。。
有位清静研究者Moczad?o讲得很透:护城河正在从「模子会见」转向「验证」。。。。。。
现在花30美元跑一次果真模子,,,,,,也能复现出Mythos级别的误差狩猎。。。。。。
真正稀缺的,,,,,,是那套既能证实误差为真、又不把开发者埋进误报堆里的系统。。。。。。
以是,,,,,,以后拼的不再是谁能挪用最强的模子,,,,,,而是谁能把模子、数据、智能体、验证,,,,,,打造成一套一连运转、还信得过的清静行动系统。。。。。。
系统的牌桌,,,,,,才刚刚开局。。。。。。
参考资料:
https://x.com/satyanadella/status/2081779755146482153?s=20
https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/
https://arxiv.org/pdf/2506.02548
https://blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/
编辑:元宇