erwinmsmith/SOMAS
A Trusted Human-Multi-Agent Reinforcement Learning Interaction Framework
解决的问题
SOMAS 解决了在人机协同危机响应中确保安全性和可靠性的挑战。通过在任务效用与严格安全约束之间取得平衡,防止紧急情况下的高风险 AI 行为。
工作原理
该框架采用结合视觉语言模型和强化学习的双模式架构:
- 在线执行系统:通过包含模块化任务链和安全防护机制的规划-执行流水线,管理实时任务,包括基于 GPT-4 的风险评估。
- 离线仿真系统:利用合成任务生成和经验回放库,训练和优化用于风险预测的强化学习策略。
适用对象
需要人类监督的高风险、安全关键型环境中,开发多智能体系统的应急响应团队和开发者。
主要亮点
- 双模式架构:结合实时执行与离线仿真训练。
- 安全的 LLM:包含专为紧急场景微调的 LLM 和训练数据集。
- 经验证的性能:相比基线,风险响应率降低 40%,帮助性提升 15%。
相关
- 项目
- 项目
- 项目
- 项目
- 项目