MAI-Cyber-1-Flash 內含於 MDASH – Microsoft AI 公告

MAI-Cyber-1-Flash 內含於 MDASH – Microsoft AI 公告

總覽

Microsoft 在 MDASH 內推出 MAI-Cyber-1-Flash,相較於其先前最佳方案,在 CyberGym 基準上達到最高表現,並降低 50% 成本。

模型架構與血統

MAI-Cyber-1-Flash 是一個緊湊且程式碼密集的安全模型,源自 MAI-Thinking-1 血統,內部使用高品質資料構建。

在 CyberGym 上的表現

在 CyberGym 基準上,MDASH 結合 MAI-Cyber-1-Flash 與 GPT-5.4 取得 95.95% 的成功率,比 Mythos 高 12 個百分點,並超過其他模型 83.2%–85.6% 的範圍。

成本效益與多模型策略

系統設計讓 MAI-Cyber-1-Flash 處理多達 90% 的任務,從而讓較大且成本更高的 GPT-5.4 模型僅保留用於剩餘 10% 的極具挑戰性任務;此劃分相較於 MDASH 先前的最佳方案(GPT 5.4 + 5.4 mini + 5.3 codex)可節省 50% 成本。

數據與 harness 優勢

Microsoft 的遙測提供身份、端點、雲端與網路方面每日兆級的訊號,並擁有無與倫比的真實漏洞與修復記錄;MDASH 的多代理 harness 經業界專家調校,包含 100+ 個使用多種領先模型的代理,提升了模型的效能。

安全、治理與企業控管

由於這是 Microsoft 首款網路安全模型,MAI-Cyber-1-Flash 在開發時採用安全優先的校準,經 Microsoft AI Red Team 嚴格評估,透過自動化及專家領導的對抗演練進行測試,並接受第三方獨立評估;企業控管功能如角色基礎存取、租戶隔離、加密、審計追蹤以及無網際網路存取的沙箱執行,皆透過 MDASH 提供。

強化學習迴路與未來代理系統

Microsoft 的安全運營每日從 160 萬客戶產生超過 100 兆個安全訊號,構建一個即時的強化學習迴路,持續提升模型;新推出的 Perception 代理安全系統將把 MAI‑Cyber‑1‑Flash 擴展至漏洞識別以外的其他安全工作流程。

社群問題與限制

評論者提出了幾個公告尚未涵蓋的問題:

"如果我在開玩笑,這是否意味著 Microsoft 的模型在修復 Microsoft 產品方面最佳,因為他們擁有關於 Microsoft 產品問題的兆級資料點?" – @gste

"它在 Linux 上能運作嗎?" – @tesdinger

"請公開權重嗎?" – @LorenDB

"這些安全相關內容有多少是開源的?模型、訓練資料、評估基準?" – @chvid

"問題在於他們使用了 cybergym,這個基準現在已經飽和好幾個月了。" – @danieltk76

這些言論凸顯了對平台相容性、模型開放性、命名慣例以及 CyberGym 基準目前飽和狀況的擔憂。

Sources