erwinmsmith/SOMAS
A Trusted Human-Multi-Agent Reinforcement Learning Interaction Framework
何を解決するか
SOMASは、人間と機械の共同危機対応における安全性と信頼性を確保する課題に対処します。緊急事態におけるリスクの高いAI行動を防ぐために、タスクの有用性と厳格な安全制約のバランスを取っています。
動作方法
このフレームワークは、視覚言語モデルと強化学習を組み合わせた二重モードアーキテクチャを使用しています。
- オンライン実行システム: モジュール化されたタスクチェーンと安全ガードレールを備えた計画-実行パイプラインを通じてリアルタイムタスクを管理し、GPT-4ベースのリスク評価を含みます。
- オフラインシミュレーションシステム: 合成タスク生成と経験リプレイライブラリを使用して、リスク予測のための強化学習ポリシーを訓練・最適化します。
対象ユーザー
人間の監視が必須となる高リスク・安全が重要な環境でマルチエージェントシステムを開発する緊急対応チームや開発者。
主な特徴
- 二重モードアーキテクチャ: リアルタイム実行とオフラインシミュレーション訓練を組み合わせます。
- 安全なLLM: 緊急事態シナリオ専用に微調整されたLLMとトレーニングデータセットを含みます。
- 実証された性能: ベースラインと比較して、リスク対応率を40%削減し、有用性を15%向上させました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト