Anthropic Fable Guardrails Face Backlash from Cybersecurity Researchers

Overly Restrictive Guardrails Impede Legitimate Research

AnthropicのFableモデル(サイバーセキュリティに特化したMythosモデルの公開版)は、非悪意的なリクエストを頻繁にブロックしてしまうガードレールにより、セキュリティコミュニティから大きな批判に直面しています。研究者たちは、モデルがサイバーセキュリティや生物学にわずかに関連するだけのタスクを拒否し、意図ではなく単純なキーワードによってトリガーされることが多いと報告しています。

セキュリティの専門家は、過剰なブロックのいくつかの例を挙げています:

  • Innocuous Reading: IBM X-ForceのValentina ‘Chompie’ Palmiottiは、Fableがブログ記事の閲覧といった単純なリクエストであっても、それがサイバー関連とみなされると拒否すると指摘しています。
  • Secure Coding: TolmoのMatt Suicheは、モデルにセキュアなコードを書くよう依頼すると、モデルがそのリクエストをソフトウェアエンジニアリングのベストプラクティスではなく、サイバーセキュリティ業務として解釈するため、しばしば機能のダウングレードが発生すると述べています。
  • General Code Review: 研究者たちは、基本的なコードレビューの依頼であってもフラグが立てられると報告しています。
  • Non-Cyber Tasks: ユーザーは、写真の中の菌類を特定したり、ミトコンドリアについて尋ねたりといった基本的な生物学の質問が、潜在的な生物兵器の開発としてフラグを立てられる事例を報告しています。

Model Degradation and the "Fallback" Mechanism

Fableの安全対策がトリガーされると、システムは単にプロンプトを拒否するだけでなく、チャットを一時停止し、ユーザーを自動的にClaude Opus 4.8に切り替えます。このメカニズムは、ユーザーによって能力の「ダウングレード」であると表現されています。

批判的な人々は、このアプローチが欺瞞的なユーザー体験を生み出していると主張しています。あるユーザーは、即座に明確な説明がないまま、より低性能なモデルに切り替えることで、研究を静かに「妨害」する可能性があると指摘しています。ただし、Anthropicは、サイバーセキュリティや生物学的な理由で切り替えが発生した場合にはその旨を明示しています。 このフォールバック(代替)動作は、Cyber Verification Program (CVP) に申請した人々にとって特に不満が溜まるものです。一部のユーザーは、Android kernel developmentのような特定のタスクに対する免除を受けているにもかかわらず、制限が継続していると報告しています。

The Tension Between Safety and Utility

Anthropicは、これらの制限がマルウェアや生物兵器の開発を防ぐために必要であると主張しています。同社は以前、重要なインフラを基盤として、Project Glasswingを通じて、より強力なMythosモデルを少数の組織に限定して提供していました。

しかし、コミュニティの反応は、安全性の目標と実用性の間の不一致を示唆しています:

"So a determined attacker rewrites the prompt and gets through, and the IBM X-Force researcher trying to read a blog post gets blocked. Working as intended, apparently."

一部の専門家は、ガードレールが単純すぎる(too blunt)と指摘しています。プロンプトの文脈をニュアンスとして理解するのではなく、語彙フィールドやキーワード(「genetics」や「buffer overflow」など)に依存しているためです。これにより、ガードレールが、悪意のある攻撃者を止めることができず、一方で正当当な専門家を妨げる「スピードバンプ(段差)」として機能しているという懸念が生じています。

Industry Response and Policy Shifts

広範な範疇での非難を受けて、Anthropicは一部のポリシーを撤回し始めています。Wiredのレポートによると、Anthropicは次のように述べています。「Fable 5のフロンティアLLM開発のためのセーフガードを、可視化できるように変更します。私たちは誤ったトレードオフを行いました。バランスを適切に取れなかったことをお詫歉します。」

それにもかかわらず、ユーザーは、リバースエンジニアリング、プライバシーツール、有機化学などの専門分野におけるモデルの有用性について、引き続き問題を報告しており、現在の状態では、これらの専門的なアプリケーションにおいてモデルが実質的に使用不可能であると主張しています。

Sources