Liquid AIの LFM2.5-8B-A1B:オンデバイス MoE の限界に挑む

消費者向けハードウェア上で高性能 AI を実現しようとする試みは、長らく性能とレイテンシのトレードオフでした。最先端モデルは膨大な知識を提供しますが、クラウド依存のためプライバシー問題や大きな遅延が生じます。Liquid AI は LFM2.5-8B-A1B をリリースし、エッジ最適化された Mixture‑of‑Experts(MoE)モデルで、ローカルデバイス上で高速かつ信頼性の高いツール呼び出しとエージェントタスクを実現し、このジレンマを打破しようとしています。

事前学習を 38 兆トークンにスケールし、推論優先のアーキテクチャを導入することで、Liquid AI はエントリーレベルのノートパソコンに収まるモデルを提供しつつ、はるかに大規模なデンスモデルと競合できることを目指しています。このリリースは「ローカルファースト」AI への大きな転換点であり、ツールディスパッチループ(質問、提案、確認、コマンド実行のプロセス)が完全にユーザーのマシン上で完結します。

アーキテクチャの進化:LFM2 から LFM2.5 へ

LFM2.5-8B-A1B は単なるバージョンアップではなく、前身の LFM2-8B-A1B に比べて大幅に強化されたモデルです。最も顕著な変更点は、コンテキスト、トークナイゼーション、そして情報処理の根本的な方式にあります。

拡張されたコンテキストとトークナイゼーション

エッジモデルにとって最大のボトルネックの一つは長文処理能力です。Liquid AI はコンテキストウィンドウを 32,768 から 128,000 トークン に拡張しました。これは、推論とツール使用のための 2T トークン中間学習フェーズに続き、RoPE ベースを拡大して 400B トークンのフェーズを実施する二段階プロセスで実現されています。

同時に語彙数を 65,536 から 128,000 に倍増させました。この拡張は非ラテン文字スクリプトを対象としたもので、タイ語(+238.2%)、ベトナム語(+117.9%)、ヒンディー語(+120.4%)といった言語で劇的な効率向上をもたらしました。

推論専用へのシフト

前バージョンとは異なり、LFM2.5-8B-A1B は 推論専用モデル です。最終回答を出す前に明示的なチェーン・オブ・ソート(CoT)を生成します。Liquid AI は、MoE モデルは通常計算リソースに制約があるため、トークンごとにアクティブになるパラメータが少なく、推論トークンの生成は計算上「安価」だと指摘し、速度感への大きな影響なく品質向上が可能になると説明しています。

「エッジモデル」課題の解決:幻覚とドゥームループ

小規模モデルは知識容量が限られるため、幻覚や長い推論トレースでの繰り返し「ドゥームループ」につながりやすいです。Liquid AI はこの問題に対処するため、以下の 2 つの戦略を実装しました:

  1. Anti-Doom Loop Optimization(ドゥームループ防止最適化):ループを引き起こすトークンを特定するターゲット型プリファレンス最適化段階です。確率質量を妥当な代替案へ再配分し、再開語(例:"Wait...")を抑制する RL シェーピング報酬を用いることで、繰り返しサイクルに陥りにくくします。
  2. Knowledge Boundary Sharpening(知識境界の鋭化):幻覚抑制のため、 diverse な知識データセット上で avg@k ベースの報酬を使用しました。これにより、信頼できる知識ベース外の質問に対して回答を控える能力が強化され、不確実性の表現が明確になります。

パフォーマンスとベンチマーク

Liquid AI によると、モデルは前バージョンに比べて大幅に改善されており、特に AA‑Omniscience Index が +53.62、Non‑Hallucination Rate が 7.46% から 63.47% に跳躍しています。

Qwen3.5-4B や Gemma-4 系列といった他の小規模モデルとの比較ベンチマークでは、LFM2.5-8B-A1B は指示遵守(IFEval)やエージェントワークフロー(Tau² Telecom)で高い競争力を示します。ただし、コミュニティからは重要な指摘も出ています。あるユーザーは、一般ベンチマークでは優秀でも、専門タスクでは遅れを取ることがあると報告しています。例えば、バグ修正ベンチマークでは Qwen2.5‑Coder‑3B が LFM2.5 を大きく上回り、約 50% のバグを修正したのに対し、LFM の修正率は約 12% にとどまっています。

ハードウェアスループット:"クラス最速"

Liquid AI は、さまざまなハードウェア上での効率性を強調しています。llama.cpp、MLX、vLLM、SGLang へのデイワンサポートを提供することで、Apple、AMD、Intel、Qualcomm、Nvidia のハードウェア全てでモデルを利用可能にしています。

  • CPU Performance(CPU 性能):M5 Max 上では 253 トークン/秒、Ryzen AI Max+ 395 上では 146 トークン/秒でデコードし、メモリ使用は 6 GB 未満に抑えられます。
  • GPU Performance(GPU 性能):単一の NVIDIA H100 では高い同時実行性で 1 秒あたり 18.5K 出力トークンに達します。

コミュニティの視点と批判的分析

技術仕様は印象的ですが、Hacker News コミュニティは以下の点に注意を喚起しています:

  • Overtraining Concerns(過学習の懸念):8 B モデルに対して 38 T トークンという膨大なデータ量は、従来の Chinchilla スケーリング法則をはるかに超えており、ベンチマークへの過適合が疑われます。
  • Licensing Nuances(ライセンスのニュアンス):ブログではモデルを "Open-weight" かつ "without restrictions" と表現していますが、年商 1,000 万ドル超の組織に対する重大な制限がライセンスに含まれています。
  • Identity Confusion(アイデンティティの混乱):一部の早期テスターは、モデルが時折自らを Google 製品と認識することを報告しており、訓練データからの漏洩やアーティファクトの可能性が示唆されています。

結論

LFM2.5-8B-A1B は、完全にプライベートなオンデバイスエージェントへ向けた大胆な一歩です。膨大な事前学習コーパスと専門的な推論アーキテクチャ、積極的な幻覚抑制を組み合わせることで、Liquid AI は "十分に良い" ローカルモデルがクラウドサブスクリプションの必要性を大多数の日常タスクで代替できることを証明しようとしています。コーダー特化型モデルの専門性能に匹敵できるかは未だ不透明ですが、消費者ハードウェア上でのスループットと効率性は大きな成果と言えるでしょう。

Sources