Anthropic Improves Claude Fable 5 Biology Safeguards

Anthropicは、Claude Fable 5の生物学に関するセーフガードを更新し、製品全体で生物学に関連する「フォールバック」(システムがクエリをより能力の低いモデルにリダイレクトすること)を約85%削減しました。このアップデートにより、Fable 5は、高リスクなデュアルユース(軍民両用)能力の制限を継続しつつ、教育的なクエリや日常的な健康に関する質問を含む、より広範な良性の生物学タスクを支援できるようになります。

Expanded Access to Benign Biology Tasks

Fable 5は、誤検知を大幅に減らしながら、より幅広い生物学関連のリクエストを処理できるようになりました。ユーザーは、以下のタスクを実行する際に、中断が少なくなります:

  • Everyday Health and Education: 検査結果の解釈、症状の理解、教育的な文脈での生物学の学習。
  • Clinical Support: 医療従事者は、臨床タスクにおいてFable 5からより多くのサポートを受けることができます。

これらの改善にもかかわらず、Fable 5は、ウイルス学、毒性学、および分子設計に関連するリクエストを引き続きOpus 5にルーティングします。これらの分野はデュアルユースに分類され、専門的な生物学研究や創薬開発にはまだ利用できません。

The Risk of Dual-Use Biological Capabilities

Anthropicは、Fable 5の生物学的能力が特定の複雑なタスクにおいて専門家を凌駕する可能性があるため、厳格なセーフガードを維持しています。これは、悪意のあるアクターによる「アップリフト(能力向上)」のリスクを生み出します。主な課題は、生物学研究の「デュアルユース」という性質にあります。つまり、有益な目的で使用されるのと同じ技術が、危害を加えるために転用される可能性があるということです。

  • Ambiguity of Intent: 治療法の研究には、しばしば危険な化合物の生成が必要となります。例えば、生ワクチンを作成するには、ワクチンが防ごうとしているものと同じ病原体を培養する必要があります。また、高血圧治療薬であるcaptoprilの開発には、ヘビの毒の毒性成分を単離することが必要でした。
  • External Threats: Anthropicは、米国情報機関の2026年次脅威評価を引用しています。そこでは、合成生物学やゲノム編集の進歩が、新たな生物学的脅威をもたらす可能性があることが指摘されており、特に攻撃的な生物・化学兵器プログラムを持つ国家アクターによるものが懸念されています。

壊滅的な悪用の可能性があるため、Fable 5は当初、セーフガードを洗練させる間、他のドメインでの一般的な利用可能性を確保するために、ほぼすべての生物学に関するクエリをブロックするようにリリースされました。

Technical Implementation of Biology Safeguards

Anthropicは、Fable 5がセーフガード対象のタスクを実行するように求められたり、有害な出力を生成したりする場合を検知するため、セーフティ・クラシファイア(より小規模で自動化されたAIシステム)というものを使用しています。

The Fallback Mechanism

セーフティ・クラシファイアがトリガーされた場合、システムは単にリクエストをブロックするのではなく、代わりにユーザーのクエリをOpus 5にリダイレクトします。Opus 5は能力の高いモデルですが、Fable 5の高度な生物学的能力を欠いているため、悪意のあるユーザーが受け取れる支援を制限することができます。

Refining the Classifier

誤検知を増やさずに偽陰性(有害なコンテンツの流出)を減らすために、Anthropicは以下のアップデートを実装しました:

  1. Constitutional Rewrite: チームは、セーフガード対象と許可されたコンテンツを判別するために使用される「憲法(constitution)」、つまりクラシファイアのルールセットを書き換え、良性の利用法をより詳細に定義しました。
  2. Expert Consultation: Anthropicは、これらの変更について、社内外の多様な専門家グループからフィードバックを求めました。
  3. Retraining: クラシファイアは、新しい憲法に基づいて更新されたトレーニングデータを使用して再学習され、有害およびデュアルユースの研究については引き続きトリガーされることを確認しつつ、より多くの良性のコンテンツを許可するように検証されました。

Anthropicは、一部の誤検知が「安全マージン」内に残ることを認めています。これは、過剰な慎重さから、低リスクのリクエストが依然としてブロックされる場合があることを意味します。同社は、専門的な研究者が最先端の生物学的能力を安全に利用するための、信頼できるアクセス経路の開発に引き続き取り組んでいます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch