Anthropic が Petri アライメントツールを Meridian Labs に寄付

Anthropic は、オープンソースのアライメントツールボックスである Petri の開発を、非営利団体の Meridian Labs に移管し、ツールのバージョン 3.0 をリリースしました。この動きにより、アライメントテストフレームワークが特定のAI研究所に依存しなくなり、業界全体で大規模言語モデル(LLM)の評価を中立的かつ信頼性の高いものに保つことが可能になります。

Petri 3.0 の技術的進化

Petri 3.0 は、アライメントテストの正確性と有用性を高めるために、3つの主要なアーキテクチャおよび機能的改善を導入しています。

高い柔軟性

Petri 3.0 は、監査モデルとターゲットモデルを分離する主要なアーキテクチャ変更を実装しています。この分離により、ユーザーは各コンポーネントを独立して調整・修正でき、より幅広い用途に適応できるようになります。

「Dish」による現実性の向上

モデルがテストされていると認識してしまうことを防ぐため(これは一般のパフォーマンスを反映しない行動を引き起こす可能性があるため)に、Anthropic は「Dish」というアドオンを導入しました。Dish は、モデルの実際のシステムプロンプトと、本番環境で使用されるリアルな「スキャフォールド」(モデルの目的達成を支援するためのソフトウェアラッパー)を活用することで、テスト環境の現実性を高めます。

Bloom統合によるより深い行動評価

Petri は現在、Anthropic が開発した別のオープンソースアライメントツールである Bloom と統合されています。Petri は広範な評価を提供する一方で、Bloom との統合により、特定の選択された行動についてより詳細な評価が可能になります。

操作フレームワークと利用事例

Petri は、別個の「監査モデル」を使用してアライメントに関連するシナリオをシミュレートします。その後、「ジャッジモデル」が得られたトランスクリプトを評価し、アライメントのずれを示す行動を特定します。このツールは、以下のような懸念される傾向を検出することを目的としています:

  • 欺瞞
  • 逢いの態度(媚びた態度)
  • 有害な要求との協力

Anthropic は、Claude Sonnet 4.5 以降のすべての Claude モデルのアライメント評価プロセスに Petri を統合しています。また、英国のAIセキュリティ研究所(AISI)も、モデルがAI研究を妨害する傾向があるかどうかを評価する際の中心的な要素として Petri を利用しています。

Meridian Labs への移管

Anthropic は、Petri の開発を AI 評価を専門とする非営利団体である Meridian Labs に移管しました。この移管は、Anthropic が Model Context Protocol(MCP)を Linux Foundation に寄付したのと同様のパターンです。Petri を非営利団体に移管することで、このツールは、Inspect や Scout などの他のツールとともに、研究機関、独立研究者、政府が信頼性と中立性のあるAIモデル行動のテストに利用できる、拡大するオープン技術スタックの一員となります。

Sources

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch