MoonshotAI/Kimi-K2.5

Open Visual Agentic Intelligence

何を解決するか

Kimi K2.5 は、視覚と言語理解のギャップを埋めつつ、高度なエージェント機能を提供するように設計されています。異なるモダリティ(テキスト、画像、動画)間で推論できるだけでなく、複数の専門エージェントを調整して自律的に複雑なタスクを実行できるモデルを構築するという課題に対処します。

動作方法

K2.5 は、1兆パラメータ(1トークンあたり320億パラメータがアクティブ)のMixture-of-Experts(MoE)アーキテクチャを用いたネイティブなマルチモーダルモデルです。15兆の混合視覚およびテキストトークンを継続的に事前学習することで開発されました。モデルはMoonViT視覚エンコーダーとMLA(Multi-head Latent Attention)を使用し、最大256Kトークンのコンテキスト長を扱えます。"インスタント"モードと"思考"モードの両方をサポートしており、高速応答と深い推論の間で切り替えが可能です。

対象ユーザー

このモデルは、高度なAIエージェント、マルチモーダルアプリケーション、視覚的根拠が必要な自動コードツール(UIデザインからコードへの変換など)を開発する開発者や研究者を対象としています。

主な特徴

  • ネイティブなマルチモーダル性:クロスモーダル推論のための統合された視覚と言語理解。
  • エージェントスウォーム:複雑なタスクを並列処理可能なサブタスクに分解し、ドメイン特化エージェントが処理する自律的実行スキーム。
  • 視覚によるコード生成:UIデザインや動画ワークフローなどの視覚的仕様から直接コードを生成できる能力。
  • 大規模スケール:15兆トークンの膨大なデータセットで学習された1TパラメータのMoEアーキテクチャ。

関連