Meta Muse Spark 1.3 發佈

Meta 已發佈 Muse Spark 1.3,這是一款專為長程代理工作流(long-horizon agentic workflows)和高性能競爭性編碼而設計的模型。此次發佈重點在於提高首次嘗試的準確度、可靠的工具調用以及原生多模態感知,使其在編碼任務中成為領先模型的具備競爭力的替代方案。

高性能編碼與代理工作流

Muse Spark 1.3 旨在處理複雜、多步驟的推理任務,這些任務需要在長時程中追蹤上下文和先前的結果。與標準 LLM 不同,該模型經過微調,能夠處理混亂或衝突的輸入,並在必要時主動要求澄清,以減少工作流中不必要的輪次。

關鍵技術能力包括:

  • 代理優化 (Agentic Optimization):針對長程任務進行了優化,使模型能夠充當開發夥伴或編碼代理的核心。
  • 競爭性編碼 (Competitive Coding):經過微調以獲得更整潔的輸出和更高的首次嘗試準確度,在多項編碼評估中表現出與領先模型相當的競爭力。
  • 原生多模態感知 (Native Multimodal Perception):模型可以感知影片、圖像和文件。其視覺推理是透過真實的執行環境而非腳本步驟來執行的,這使其能夠根據截圖或影片片段來構建軟體。

基準測試與性能

根據社群報告和提供的數據,Muse Spark 1.3 在編碼基準測試中展現了強大的結果。具體而言,它達到了 75.4 的 DeepSWE 分數,用戶指出這是一個頂尖的分數。此外,一些用戶報告稱,Muse Spark 1.3 Max 在 Artificial Analysis Intelligence Index 上超越了 OpenAI 的最佳模型。

定價與數據隱私層級

Meta 為 Muse Spark 1.3 引入了透明的分層定價結構,明確地將成本與數據隱私掛鉤。該模型提供兩個主要版本:

Model Context Window Input (per Mtok) Cached Input (per Mtok) Output (per Mtok) Data Usage
muse-spark-1.3-contributor 1M $0.10 $0.002 $0.20 Used to improve Meta products
muse-spark-1.3 1M $1.25 $0.15 $4.25 Not used to improve Meta products

「contributor」層級為允許 Meta 使用其數據進行訓練的用戶提供了顯著的折扣(約 20 倍),這一舉動因其透明度而受到一些人的稱讚,但也因其將用戶數據變現的方式而受到其他人的批評。

開發者生態系統與工具

Meta 提供幾種部署和整合 Muse Spark 1.3 的方式:

  • Muse Code:一個專為 Muse Spark 設計的終端機多代理編碼框架。
  • Meta Model API:一個與 OpenAI SDK 相容的自助式 API。
  • OpenRouter:用於將模型切換到現有工作流的整合方式。

Meta 還發佈了幾本「食譜」(cookbooks) 來展示進階的代理能力,包括多代理協作(從一行想法創建 SaaS 應用程式)、代理擴散 (agent fan-out,即並行工作樹)、電腦使用 (computer use,賦予模型「眼睛和雙手」來構建軟體) 以及用於即時網路存取的搜尋接地 (search grounding)。

社群洞察與反對意見

開發者對 Muse Spark 1.3 的回饋是褒貶不一,但對於其速度和成本效益普遍持正面評價。

"I started using Spark 1.2 for development... it felt like it knew its weaknesses and didn't try to impose its opinions on me... it did what I told it and if there was something unexpected in the code that it put out it was often because I gave it ambiguous or conflicting instructions."

一些用戶對模型傾向於在某些路徑上過度擬合,或者它可能還不是每個使用案例的絕對最先進技術 (SOTA) 表示擔憂,一些用戶引用 Gemini 3.8 Flash 或 Sol models 作為特定場景下的優越替代方案。其他人則強調了對 Meta 公司歷史的倫理考量,這影響了他們選擇模型提供商的決於。

Sources

相關