MoonshotAI/Kimi-K2.5

Open Visual Agentic Intelligence

解決的問題

Kimi K2.5 設計用於彌合視覺與語言理解之間的差距,同時提供先進的代理能力。它解決了建立一個不僅能跨不同模態(文字、影像、影片)進行推理,還能透過協調多個專業代理自主執行複雜任務的模型的挑戰。

工作原理

K2.5 是一種基於 1 兆參數(每 token 激活 320 億參數)的混合專家(MoE)架構所建構的原生多模態模型。它透過在 15 兆混合視覺與文字 token 上進行持續預訓練而開發。該模型使用 MoonViT 視覺編碼器與 MLA(多頭潛在注意力)來處理高達 256K token 的上下文長度。它支援「即時」與「思考」兩種模式,允許在快速回應與深度推理之間切換。

適用對象

此模型適用於開發高階 AI 代理、多模態應用,以及需要視覺定位(例如將 UI 設計轉換為程式碼)的自動化編碼工具的開發者與研究人員。

主要亮點

  • 原生多模態性:整合視覺與語言理解,實現跨模態推理。
  • 代理群集:一種自導向執行方案,將複雜任務分解為由領域專用代理並行處理的子任務。
  • 基於視覺的編碼:能夠直接從 UI 設計或影片工作流程等視覺規格生成程式碼。
  • 超大規模:基於 15 兆 token 的龐大資料集訓練而成的 1T 參數 MoE 架構。

相關