erwinmsmith/SOMAS

A Trusted Human-Multi-Agent Reinforcement Learning Interaction Framework

解决的问题

SOMAS 解决了在人机协同危机响应中确保安全性和可靠性的挑战。通过在任务效用与严格安全约束之间取得平衡,防止紧急情况下的高风险 AI 行为。

工作原理

该框架采用结合视觉语言模型和强化学习的双模式架构:

  • 在线执行系统:通过包含模块化任务链和安全防护机制的规划-执行流水线,管理实时任务,包括基于 GPT-4 的风险评估。
  • 离线仿真系统:利用合成任务生成和经验回放库,训练和优化用于风险预测的强化学习策略。

适用对象

需要人类监督的高风险、安全关键型环境中,开发多智能体系统的应急响应团队和开发者。

主要亮点

  • 双模式架构:结合实时执行与离线仿真训练。
  • 安全的 LLM:包含专为紧急场景微调的 LLM 和训练数据集。
  • 经验证的性能:相比基线,风险响应率降低 40%,帮助性提升 15%。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目