erwinmsmith/SOMAS

A Trusted Human-Multi-Agent Reinforcement Learning Interaction Framework

해결하는 문제

SOMAS는 인간-기계 공동 위기 대응에서 안전성과 신뢰성을 보장하는 도전 과제를 해결합니다. 긴급 상황에서 위험한 AI 행동을 방지하기 위해 작업 유용성과 엄격한 안전 제약 조건의 균형을 유지합니다.

작동 방식

이 프레임워크는 시각-언어 모델과 강화 학습을 결합한 이중 모드 아키텍처를 사용합니다.

  • 온라인 실행 시스템: 모듈식 작업 체인과 안전 가드레일을 갖춘 계획-실행 파이프라인을 통해 실시간 작업을 관리하며, GPT-4 기반의 위험 평가를 포함합니다.
  • 오프라인 시뮬레이션 시스템: 합성 작업 생성과 경험 재생 라이브러리를 사용하여 위험 예측을 위한 강화 학습 정책을 훈련 및 최적화합니다.

대상 사용자

인간의 감시가 필수적인 고위험·안전이 중요한 환경에서 다중 에이전트 시스템을 개발하는 긴급 대응 팀 및 개발자.

주요 특징

  • 이중 모드 아키텍처: 실시간 실행과 오프라인 시뮬레이션 훈련을 결합합니다.
  • 안전한 LLM: 긴급 상황 전용으로 미세 조정된 LLM과 훈련 데이터셋을 포함합니다.
  • 검증된 성능: 베이스라인 대비 위험 대응률을 40% 감소시키고, 유용성을 15% 향상시켰습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트