MAI-Cyber-1-Flash 內含於 MDASH – Microsoft AI 公告
MAI-Cyber-1-Flash 內含於 MDASH – Microsoft AI 公告
總覽
Microsoft 在 MDASH 內推出 MAI-Cyber-1-Flash,相較於其先前最佳方案,在 CyberGym 基準上達到最高表現,並降低 50% 成本。
模型架構與血統
MAI-Cyber-1-Flash 是一個緊湊且程式碼密集的安全模型,源自 MAI-Thinking-1 血統,內部使用高品質資料構建。
在 CyberGym 上的表現
在 CyberGym 基準上,MDASH 結合 MAI-Cyber-1-Flash 與 GPT-5.4 取得 95.95% 的成功率,比 Mythos 高 12 個百分點,並超過其他模型 83.2%–85.6% 的範圍。
成本效益與多模型策略
系統設計讓 MAI-Cyber-1-Flash 處理多達 90% 的任務,從而讓較大且成本更高的 GPT-5.4 模型僅保留用於剩餘 10% 的極具挑戰性任務;此劃分相較於 MDASH 先前的最佳方案(GPT 5.4 + 5.4 mini + 5.3 codex)可節省 50% 成本。
數據與 harness 優勢
Microsoft 的遙測提供身份、端點、雲端與網路方面每日兆級的訊號,並擁有無與倫比的真實漏洞與修復記錄;MDASH 的多代理 harness 經業界專家調校,包含 100+ 個使用多種領先模型的代理,提升了模型的效能。
安全、治理與企業控管
由於這是 Microsoft 首款網路安全模型,MAI-Cyber-1-Flash 在開發時採用安全優先的校準,經 Microsoft AI Red Team 嚴格評估,透過自動化及專家領導的對抗演練進行測試,並接受第三方獨立評估;企業控管功能如角色基礎存取、租戶隔離、加密、審計追蹤以及無網際網路存取的沙箱執行,皆透過 MDASH 提供。
強化學習迴路與未來代理系統
Microsoft 的安全運營每日從 160 萬客戶產生超過 100 兆個安全訊號,構建一個即時的強化學習迴路,持續提升模型;新推出的 Perception 代理安全系統將把 MAI‑Cyber‑1‑Flash 擴展至漏洞識別以外的其他安全工作流程。
社群問題與限制
評論者提出了幾個公告尚未涵蓋的問題:
"如果我在開玩笑,這是否意味著 Microsoft 的模型在修復 Microsoft 產品方面最佳,因為他們擁有關於 Microsoft 產品問題的兆級資料點?" – @gste
"它在 Linux 上能運作嗎?" – @tesdinger
"請公開權重嗎?" – @LorenDB
"這些安全相關內容有多少是開源的?模型、訓練資料、評估基準?" – @chvid
"問題在於他們使用了 cybergym,這個基準現在已經飽和好幾個月了。" – @danieltk76
這些言論凸顯了對平台相容性、模型開放性、命名慣例以及 CyberGym 基準目前飽和狀況的擔憂。