Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

来源:MarkTechPost(RSS) 2026年7月28日 16:33 AIHOT 评分:71 精选
摘要:Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。
# Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% - 来源:MarkTechPost(RSS) - 作者:Asif Razzaq - 发布时间:2026-07-28 16:33 - AIHOT 分数:71 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cms4fb2n603f4roeprjoopbix - 原文链接:https://www.marktechpost.com/2026/07/28/microsoft-ai-releases-mai-cyber-1-flash-a-5b-active-parameter-cyber-model-that-pushes-mdash-to-95-95-on-cybergym ## 精选理由 微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。 ## AI 摘要 Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。 ## 正文 MAI-Cyber-1-Flash 是一款采用自注意力机制和稀疏混合专家层的 Transformer 架构模型。它拥有 1370 亿总参数量,其中 50 亿参数处于激活状态,上下文窗口长度为 256k。输入和输出仅支持文本。 该模型是对 MAI-Code-1-Flash 进行网络安全领域微调后的版本,后者是已集成到 GitHub Copilot 和 VS Code 中的轻量级智能体编程模型。发布信息称其源自 MAI-Thinking-1 系列。 评测基准 CyberGym 是一个公开的评测套件,包含来自 188 个 OSS-Fuzz 项目的 1507 个真实漏洞复现任务。微软在 CyberGym 的默认一级配置下进行评估,该配置提供存在漏洞的源代码和高级描述。 在 MDASH 系统中运行 MAI-Cyber-1-Flash 配合 GPT-5.4 时,得分达到 95.95%。微软表示这比 Anthropic 的 Mythos 高出约 12 个百分点,发布图表显示四个对比系统的得分区间为 83.2% 至 85.6%。 微软在 2026 年 5 月首次详细介绍 MDASH 时,该框架仅使用通用模型在 CyberGym 上取得了 88.45% 的分数。这已是公开排行榜上的最高分,比第二名(83.1%)高出约 5 个百分点。研究团队明确说明了改进情况:将 MDASH 中 80% 的现有模型替换后,框架得分从 88.4% 提升至 95.95%。 为何路由机制才是真正的核心产品 MDASH 通过五个阶段管理超过 100 个专业智能体:准备(Prepare)、扫描(Scan)、验证(Validate)、去重(Dedupe)和证明(Prove)。审计智能体标记发现的问题,辩论智能体就漏洞可利用性展开辩论(以分歧作为信号),证明阶段则针对 C/C++ 目标使用 ASan 执行触发输入。 为了在大规模应用中控制前沿模型成本,MAI-Cyber-1-Flash 处理 MDASH 中高达 90% 的任务,将最难的 10% 升级至 GPT-5.4。这种路由机制相比此前使用 GPT-5.4、5.4 mini 和 5.3 codex 的配置,节省了 50% 的成本。 MDASH 由微软自主代码安全(ACS)团队开发,团队成员包括曾赢得 DARPA AI 网络挑战赛的亚特兰大队成员。今年 5 月,MDASH 辅助工作生成了 16 个 CVE(包括四个严重级别的远程代码执行漏洞),涉及 Windows 网络和身份验证堆栈。回顾来看,它在五年时间窗口内恢复了 clfs.sys 中 28 个 MSRC 案例的 96%,以及 tcpip.sys 中 7 个案例的 100%。 性能 研究团队展示了来自轻量级终端测试工具的独立结果: 基准测试MAI-Cyber-1-Flash CVEBench0.314 CyberSecEval4 — 威胁情报0.553 CyberSecEval4 — 恶意软件分析0.33 CRSBench0.651(POV=1200) ExploitGym — 内核 / 用户空间 / 浏览器0 / 0 / 0 ExploitGym 上的零分是刻意为之,并非缺陷。微软团队表示,该模型经过训练用于执行防御性任务(如修补漏洞),而非攻击性任务(如部署恶意软件)。一个 5B 活跃参数的模型无法生成漏洞利用代码,却能驱动 95.95% 的发现流程——这正是纯防御型产品所需的特性。 如何使用 核心要点 MAI-Cyber-1-Flash 总参数量 137B / 活跃参数 5B,是基于 MAI-Code-1-Flash 的稀疏 MoE 微调版本,支持 256k 上下文窗口。 CyberGym 上的 95.95% 是系统级得分——由 MDASH 加上新模型以及 GPT-5.4 共同实现,较 2026 年 5 月的 88.45% 有所提升。 它可处理高达 90% 的 MDASH 任务,将困难的 10% 升级给 GPT-5.4,据称可削减 50% 成本。 ExploitGym 得分按设计为 0/0/0——该模型用于修补漏洞,不编写漏洞利用代码。 访问权限受控。