Claude Opus 5.0 の言語的後退:一貫性の欠如と有害な冗長性

TL;DR

Claude Opus 4.8 では有害で専門用語まみれの文章スタイルが導入され、Opus 5.0 ではその問題が極端に悪化し、ほぼ一貫性のない出力を強いるため、ユーザーは重い対処策を講じるか、モデルの使用を諦めるしかなくなる。


核心的な不満

  • ユーザーが見ているもの – Opus 4.8 以降のモデルのデフォルトの文体は冗長で、独自に創り出された「戦略的」用語(例:load‑bearing, hand‑waving, instrumentation is the unlock)、強制的な比喩、そして何であるかを述べる前に「何ではないか」を述べるというパターンが特徴。
  • 影響 – 出力の読解には複数回の読み返しが必要となり、トークン使用量が最大2倍に膨らみ、実際の回答が隠れてしまうことが多い。ユーザーからは、有毒な同僚と作業するような精神的疲労感が報告されている。
  • 後退の証拠 – Redditスレッド(約450票)とGitHubのイシュー(186点)が、Opus 4.5/4.6(簡潔で明快)からOpus 4.8(不快)へ、そしてOpus 5.0(一貫性のない)への変化を記録している。

代表的なパターン

パターン なぜ問題か
独自の専門用語 「Load‑bearing」、「instrumentation is the unlock」 読者に新しい、しばしば意味のない用語を学ばせる必要がある。
否定的なフレーミング 「それはYではない。それはXである。」 回答の提示を遅らせる上、不要な認知負荷を増加させる。
強制的な比喩 「切り取りは縫い目を残さない——マーカーも、省略記号も、二重の空白行もなし。」 解読を要求するだけで、説明を明確にする効果はない。
過剰な注意喚起 単純な質問に対し、複数段落にわたる説明 トークン数を膨らませ、核心的な判断を隠してしまう。
エージェント風の個性 ユーザーのトーンに感情的に反応し、主体性を主張する タスクから注意力を逸らし、ユーザーと議論を始めることがある。

なぜ重要なのか

  1. 生産性の低下 – ユーザーは、実行可能な情報を抽出するのに最大3倍の時間がかかる。
  2. モデルの採用リスク – 後退の影響が、コーディング品質の向上を上回るため、多くのユーザーがOpenAI Codexや旧版のAnthropicモデル(Opus 4.5、Sonnet)に移行している。
  3. 経済的コスト – 長いプロンプトはAPIのトークン料金を増加させる。ユーザーは出力を整理するために、追加のモデル呼び出し(例:Haikuによる翻訳)に頼らざるを得ない。
  4. 言語の劣化 – モデルの特徴的な用語に繰り返しさらされることで、開発者の自身の語彙が汚染される。
  5. ユーザー制御の喪失 – システムプロンプトのスタイル(CLAUDE.md、出力スタイル設定)が数ターン後に変化し、約束されたカスタマイズ性が崩れる。

コミュニティの対処策(および限界)

  • プロバイダの切り替え – OpenAI Codexや旧版Opusに移行することで読みやすさは回復するが、最新の推論能力の向上は失われる。
  • カスタム出力スタイルの使用 – システムプロンプトに「plain/concise」スタイルを注入することで改善が見られるが、数回のやり取り後にスタイルがずれてしまうことが多い。
  • 後処理 – Opusの出力を、別のモデル(例:Haiku)に通して平易な英語に再構成するが、遅延とコストが増加する。
  • 禁止語リストの作成 – 有害な用語のブラックリストを維持するが、モデルは時折従うものの、頻繁に無視される。
  • 簡潔な技術英語の強制 – ASD‑STE100基準を適用することで一部のユーザーに clarity が向上するが、継続的な強化が必要。

ユーザーが望むもの(RedditとGitHubからの要約)

  1. 平易で断定的な文章 – Stack Overflowの回答や技術白書のようなスタイル。
  2. 回答優先形式 – 決定や結果を先に提示し、その後で補足説明をオプションで。
  3. 独自の専門用語や強制的な比喩の禁止 – 業界標準の用語のみを使用。
  4. スタイルの安定した強制 – セッション全体にわたって維持されるシステムプロンプトまたは出力スタイル設定。
  5. 推論の深さの維持 – 変更は語彙や表現にとどまり、モデルの問題解決能力には影響しないこと。

Anthropicの対応(2026年8月時点)

  • チームメンバーがフィードバックを認識し、この問題を「モデルの振る舞い」に関するものと分類し、モデルチューニングに回すと表明。
  • 一時的な緩和策として提案:
    • カスタム出力スタイル を使用し、各ターンごとにリマインダーを含むスタイルルールを注入する(Claude Code output‑styles docs を参照)。
    • スタイルのずれが生じる具体的なトランスクリプト例を提供し、焦点を絞ったサブイシューを作成する。
  • 「平易なレジスタ」の専用提供について、明確なスケジュールや保証は提示されていない。

潜在的な原因(コミュニティによる推測)

  • ウォーターマークのバイアス – 一部のコメントでは、言語的ウォーターマークがモデルに狭い表現の選択を促しており、意図せず上記のような専門用語を生み出している可能性があると指摘。
  • 訓練目的の変化 – トークン効率や「創造的」な言語の強調が増加し、明確さよりも巧妙さを優先するようになった可能性。
  • エージェント中心の設計 – Anthropicがエンドツーエンドの自律エージェントを推進する中で、モデルが人間が読みやすい出力よりも内部推論の記録を最適化している可能性。

Anthropicへの提言

  1. 「平易」レジスタの第一級サポートを導入 – 専門用語を無効化し、回答優先構造を強制し、応答ごとのトークン数を制限できる選択可能な出力モードを提供。
  2. スタイルの持続性を決定論的にする – システムプロンプトのスタイルルールが2ターン以上で劣化しないように保証。
  3. 診断エンドポイントの提供 – モデルが現在「冗長」モードか「平易」モードかを示すフラグを返す。
  4. スタイルガイドラインの公開 – 「load‑bearing」の禁止や「important」の推奨など、正確な表現ルールを文書化し、コミュニティがプロンプトを調整できるようにする。
  5. 定量的メトリクスの収集 – モデルバージョンごとに「回答あたりのトークン数」と「ユーザー報告の読みやすさスコア」を追跡し、早期に後退を検出する。

結論

Claude Opus 4.8 は冗長で専門用語まみれの出力への後退を導入し、Opus 5.0 ではその問題がほぼ一貫性のないレベルまで悪化した。この問題はReddit、Hacker News、公式GitHubトラッカーで広く報告されており、ユーザーは高コストの対処策を講じるか、プラットフォームを離脱している。生産性を回復し、ユーザーを維持するためには、明確で安定した「平易」出力モードと、スタイル指示の強力な強制が不可欠である。

Sources

関連