11月の転換点:LLM進化の6ヶ月間

大規模言語モデル(LLM)の情勢は、従来のソフトウェアサイクルが緩やかに感じられるほどの速度で動いています。最近の回顧録において、Simon Willisonは、彼が「11月の転換点」と定義する、2025年11月から2026年5月までの極めて重要な期間を強調しました。この期間は、単なる一連のモデルリリースの連続以上のものを表しています。開発者がAIとどのように対話するかにおける根本的な変化、つまり実験的な補助から、信頼できる日常的な生産性ツールへの移行を意味しています。

「最良」モデルを巡る争い

過去6ヶ月間で最も顕著な側面の一つは、リーダーボードの変動性です。2025年11月から12月の間に、「最良」のモデルという称号は、主要な3つのプロバイダー、Anthropic、OpenAI、Googleの間で5回も入れ替わりました。

Claude Sonnet 4.5から始まり、王座はGPT-5.1へ、次にGemini 3へ、そしてGPT-5.1 Codex Maxへと移り、最終的にClaude Opus 4.5に落ち着きました。この急速な変動は、推論やコーディング能力におけるわずかな向上が、数ヶ月ではなく数週間単位でリリースされているという、超競争状態を示唆しています。

これらのニュアンスを追跡するために、Willisonは特定の、型破りなベンチマークを使用しています。それは、「自転車に乗るペリカン」のSVGを生成することです。このテストは、ペリカンが自転車に乗っている様子は既存のデータセットにおいて一般的なモチーフではないため、学習データの汚染を避けるように設計されています。その結果は、明確な改善の軌跡を示しており、Gemini 3.1 ProGLM-5.1が、このシュールなタスクにおいて非常に有能で、さらにはアニメーション化されたバージョンさえも生成できることが示されました。

コーディング・エージェントの台頭

「雰囲気」に基づいたリーダーボードは華やかですが、真の技術的突破口は2025年11月に起こりました。コーディング・エージェントが真に有用になったのです。

この飛躍は、主に**Reinforcement Learning from Verifiable Rewards (RLVR)**によって推進されました。コードが実際にコンパイルするか、あるいはテストスイートに合格するかといった、検証可能な結果に対してモデルを訓練することで、OpenAIとAnthropicはモデルを重要な品質の壁を突破させました。コーディング・エージェントは「時々機能する」状態から「ほとんど機能する」状態へと移行し、開発者が些細なエラーの修正に大半の時間を費やすことなく、主要なツールとして使用できるようになりました。

「Claw」現象

この新たなエージェント能力は、新しいカテゴリーのパーソナルAIアシスタントを生み出しました。OpenClawプロジェクトによって火付けられた、通称「Claws」と呼ばれるものです。このトレンドは非常に広範に広がり、ユーザーがこれらのローカル・エージェントを実行するためにハードウェアを購入したため、シリコンバレーではMac Miniが売り切れたと報じられています。

しかし、コミュニティはこれらのエージェントの長期的な生存能力について意見が分かれています。AIがコードの90%を書くという「サイバネティックな融合」を報告するユーザーもいれば、エージェントが依然として複雑で本格的なアプリケーションの開発には苦戦しており、修正しているソフトウェア・アーキテクチャへの深い理解が欠けていると主張するユーザーもいます。

ローカル・モデルの革命

過去6ヶ月間のもう一つの支配的なテーマは、オープンウェイト・モデルおよびローカル・モデルの予想外のパフォーマンスです。

  • Gemma 4: Googleの最新シリーズは、米国企業による最も有能なオープンウェイト・モデルの一つとして注目されています。
  • GLM-5.1: 中国の巨大な1.5TBのオープンウェイト・モデルであり、適切なハードウェアがあれば非常に高い効果を発揮します。
  • Qwen 3.6: ノートパソコンで動作可能な小型モデル(35B)ですが、特定のクリエイティブなコーディング・タスクにおいて、一部の最先端モデルを凌駕しています。

これは、プロプライエタリな最先端モデルとローカル・モデルの間の差が縮まっていることを示唆しており、プライバシー重視でコスト効率の高いデプロイメントを可能にしています。

批判的な視点と限界

興奮の渦にある一方で、技術的な批判者は、現在のLLMアーキテクチャにおける根本的な限界を指摘しています。コミュニティで繰り返し述べられている意見は、LLMが「魔法使いレベルのコード・ヘルパー」にはなっているものの、依然として本質的な理解を欠いているというものです。

"AIは、アック(Duck)が何であるか、その構成要素、あるいはどのようにアックを作ったのかを完全に理解しているわけではありません... それは単にアックを「唱える」方法を知っているだけです。これは、AIに適切なドキュメンテーションを記述させようとすると非常に明確になります。直接的な指示があっても、無残に失敗するのです。"

この「パターン合成」と「本質的な理解」の区別は、重要な論争点となっています。RLVRによって、モデルはコンパイル可能なコードを生成することに長けてているものの(コンパイラが検証可能な報酬を与えてくれるため)、それは必ずしもAIがビジネスロジックや実装の背後にある「理由」を理解していることを意味するわけではありません。

6ヶ月間の変化の要約

テーマ 以前の状態 転換点後の状態
Coding Agents 実験的、重い監視が必要 日常的なツール、本番環境で概ね信頼できる
Model Dominance 数ヶ月間、安定したリーダーシップ 「最良」のモデルが毎週のように急速に入れ替わる
Local Models 最先端モデルより大幅に劣る 期待を大きく上回るパフォーマンス
Training Focus 一般的なテキスト予測 RLVR (Verifiable Rewards)

Sources