Meta Muse Spark 1.3 リリース

Metaは、長期的なエージェント的ワークフローと高性能な競技プログラミング向けに特別に設計されたモデル、Muse Spark 1.3をリリースしました。このリリースは、初回試行の正確性、信頼性の高いツール呼び出し、およびネイティブなマルチモーダル認識の向上に焦点を当てており、コーディングタスクにおけるフロンティアモデルの競争力のある代替手段として位置付けられています。

高性能コーディングとエージェント的ワークフロー

Muse Spark 1.3は、長期にわたるコンテキストや以前の結果の追跡を必要とする、複雑で多段階の推論タスクを処理できるように設計されています。標準的なLLMとは異なり、このモデルは、乱雑または矛盾する入力を処理し、ワークフローにおける不要なターンを減らすために、必要に応じて積極的に明確化を求めるようにチューニングされています。

主な技術的能力には以下が含まれます:

  • Agentic Optimization: 長期的なタスク向けに最適化されており、開発パートナーまたはコーディングエージェントの中核として機能することを可能にします。
  • Competitive Coding: よりクリーンな出力と高い初回試行の正確性を実現するためにチューニングされており、いくつかのコーディング評価においてフロンティアモデルと競争力のあるパフォーマンスを発揮します。
  • Native Multimodal Perception: モデルはビデオ、画像、およびドキュメントを認識できます。その視覚的推論は、スクリプト化されたステップではなく、実際の実行環境を通じて実行されるため、スクリーンショットやビデオクリップに基づいてソフトウェアを構築することが可能です。

ベンチマークとパフォーマンス

コミュニティの報告と提供されたデータによると、Muse Spark 1.3はコーディングベンチマークで強力な結果を示しています。具体的には、DeepSWEスコアで75.4を達成し、ユーザーはこれをトップティアのスコアであると指摘しています。さらに、一部のユーザーは、Muse Spark 1.3 MaxがArtificial Analysis Intelligence IndexにおいてOpenAIの最高モデルを上回ったと報告しています。

価格設定とデータプライバシーの階層

Metaは、Muse Spark 1.3に対して、コストとデータプライバシーを明示的に結びつけた透明性の高い階層型価格構造を導入しました。モデルは主に2つのバージョンで提供されます:

Model Context Window Input (per Mtok) Cached Input (per Mtok) Output (per Mtok) Data Usage
muse-spark-1.3-contributor 1M $0.10 $0.002 $0.20 Meta製品の改善に使用される
muse-spark-1.3 1M $1.25 $0.15 $4.25 Meta製品の改善に使用されない

"contributor"階層は、Metaがデータを使用してトレーニングを行うことを許可するユーザーに対して大幅な割引(約20倍)を提供します。この動きは、その透明性によって一部から称賛される一方で、ユーザーデータをマネタイズする手段として他の人々から批判されています。

開発者エコシステムとツール

Metaは、Muse Spark 1.3をデプロイおよび統合するためのいくつかの方法を提供しています:

  • Muse Code: Muse Spark専用に構築された、ターミナル用のマルチエージェント・コーディング・ハーネスです。
  • Meta Model API: OpenAI SDKと互換性のあるセルフサービスAPIです。
  • OpenRouter: 既存のワークフローにモデルを入れ替えるための統合です。

Metaはまた、高度なエージェント的機能を実演するために、いくつかの「cookbooks」をリリースしました。これには、マルチエージェントのオーケストレーション(1行のアイデアからSaaSアプリを作成する)、エージェントのファンアウト(並列ワークツリー)、コンピューターの使用(モデルにソフトウェア構築のための「目と手」を与える)、およびリアルタイムのウェブアクセス用の検索グラウンディングが含まれます。

コミュニティの洞察と対立点

Muse Spark 1.3に関する開発者のフィードバックは様々ですが、速度とコスト効率に関しては一般的に肯定的です。

"I started using Spark 1.2 for development... it felt like it knew its weaknesses and didn't try to impose its opinions on me... it did what I told it and if there was something unexpected in the code that it put out it was often because I gave it ambiguous or conflicting instructions."

一部のユーザーは、モデルが特定のパスに過学習する傾向があることや、、まだすべてのユースケースにおいて絶対的な最先端(SOTA)ではない可能性があることを懸念しており、Gemini 3.8 FlashやSolモデルをより優れた代替案として特定のシナリオで挙げているユーザーもいます。また、他のユーザーは、Metaの企業史に関する倫理的な懸念を表明しており、それがモデルプロバイダーの選択に影響を与えています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch