Shippy: 高リスク海洋AIエージェントの構築におけるアーキテクチャと教訓

Shippy: 高リスク海洋AIエージェントの構築におけるアーキテクチャと教訓

TL;DR

Hugging Face と Ai2 は、高リスクの運用ドメイン認識のために設計された海洋AIエージェント Shippy を発表しました。誤ったデータがリソースの浪費や安全リスクを引き起こす環境での信頼性を確保するため、Shippy はペルソナと能力を分離したモジュラーアーキテクチャを採用し、ライブデータとのインターフェースに決定論的 CLI ツールを使用し、隔離されたユーザー サンドボックス内で動作します。

Agent Anatomy: Soul, Skills, and Config

Shippy は、バージョン管理、監査可能性、柔軟性を確保するために、3 つの異なるコンポーネントで構成されています:

  • Soul: エージェントのペルソナと行動の境界を定義するシステムプロンプト。これには、利用可能なデータを超えた法的判断を拒否したり推測したりしないなどの明示的な制約が含まれます。
  • Skills: 構造化されたフロントマター(agent-skills spec に従う)を持つプレーンな Markdown ファイルとして定義され、特定のタスクに対する指示を提供します。現在の機能には、Skylight API を使って船舶データとイベントをクエリし、排他的経済水域(EEZ)および海洋保護区域(MPA)の境界を検索し、船舶の航跡データを解釈し、インタラクティブなマップリンクを生成することが含まれます。
  • Config: エージェントハーネス(OpenClaw)および LLM(現在 Claude Opus 4.6)を決定するランタイム設定。

これらのコンポーネントはバージョン付けられた Docker イメージにパッケージ化され、開発者はエージェント全体を再構築することなく、設定の変更のみでモデルやハーネスを交換できるようになります。

Deterministic Tools for Nondeterministic Agents

LLM の非決定論性を緩和するため、Shippy は生の API コールを発行しません。代わりに、目的別に構築された自己文書化 CLI を通じて Skylight プラットフォームとやり取りします。

The CLI Layer

直接の API コールは、不正なページネーション、ジオメトリ エンコード エラー、および不正なフィルタ タイプを頻繁に引き起こします。Skylight CLI は、この複雑さをタイプされたフィルタ フラグ(例: skylight events search)にまとめ、内部で認証とページネーションを処理します。パイプバッファの制限を回避し、プログラムによるアクセスを確保するため、CLI はすべての出力をディスク上のローカル JSON ファイルに書き込みます。

The API Layer

CLI の下には、タイプ済みスキーマとフィールドレベルの説明を持つ標準化された API があります。この階層的アプローチ—Typed API $ ightarrow$ Deterministic CLI $ ightarrow$ Agent Skills—により、各コンポーネントを独立してテストでき、各段階での誤差の余地を縮小できます。

Sandboxed Hosting and Isolation via Mothership

Shippy は 70 か国以上の政府機関および NGO にサービスを提供しているため、厳格なデータ隔離が必須です。Ai2 は、Mothership というエージェントホスティングプラットフォームを開発しました。このプラットフォームは、各ユーザー セッションごとに専用の一時的な Kubernetes デプロイメントをプロビジョンします。

  • Session Isolation: 各ユーザー セッションでは、エージェントランタイム、スキル、および Skylight CLI を含む一連のポッドが起動されます。
  • Security: ユーザーの Skylight JWT はプロビジョン時に注入され、その特定のデータに API コールのスコープを限定します。ネットワークアクセスは必要なサービスに制限され、分析中に書き込まれたファイルはセッション終了時に削除されます。
  • Capabilities: このサンドボックス内では、エージェントは依存関係をインストールし、コードを実行し、マルチステップ分析のためのデータセットをプルすることができ、クロスユーザー データ漏洩のリスクを伴いません。

Evaluating Agent Performance over Model Performance

静的な汎用ベンチマークに頼る代わりに、Ai2 は Harbor 評価フレームワークを使用してライブデータに対して Shippy をモデル、スキル、サンドボックスを含む完全なシステムとして評価します。

The Evaluation Pipeline

専門家がシナリオと重み付け基準のルーブリックを作成します。たとえば、漁業イベントのクエリでは、応答スタイルよりもデータの正確性と境界解決が優先されます。プロセスは次の特定のパイプラインに従います:

  1. 自然言語プロンプトがサンドボックスで実行されます。
  2. LLM ジャッジが各基準を 0 から 1 の範囲で書面による理由付けとともに採点します。
  3. 重み付けされた合計が固定の合格閾値と比較されます。

Findings and Iteration

最近の評価では、エージェントが意思決定支援ではなく戦術的推奨に踏み込むこと、ジオメトリセンシティブなクエリでの境界の簡素化がイベントの見逃しを引き起こすこと、および存在しない CLI コマンドの幻覚など、特定の失敗モードが特定されました。これらの結果は、スキルの改善の次のイテレーションを直接推進します。

Future Roadmap

Ai2 は、以下の3つの主要な焦点で Shippy の機能を拡張しています:

  • Agent-driven UI control: リンクを提供するだけではなく、Shippy が Skylight マップ(フィルターと時間範囲の調整)を直接操作できるようにします。
  • Model routing: シンプルなルックアップをより小型で高速なモデルにルーティングし、複雑な調査にはフロンティア モデルを残すシステムを実装します。
  • Cross-thread memory: エージェントが異なる会話スレッド間でユーザー固有のコンテキスト(アナリストの管轄など)を記憶できるように、永続的なメモリを開発します。

SUMMARY: Hugging Face と Ai2 は、『soul』、『skills』、『config』のモジュラーシステムと決定論的ツールインターフェースを組み合わせた、高リスクの意思決定支援のために設計された海洋AIエージェント Shippy のアーキテクチャを詳しく説明しています。

TITLE: Shippy: 高リスク海洋AIエージェントの構築におけるアーキテクチャと教訓

Sources