RUC-NLPIR/ARPO

[ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

해결하는 문제

ARPO와 AEPO는 대규모 언어 모델(LLM) 에이전트가 다단계 상호작용과 도구 사용을 더 잘 처리할 수 있도록 설계된 강화학습(RL) 알고리즘입니다. 특히 외부 도구로부터 피드백을 받을 때 발생하는 높은 불확실성(엔트로피)에 초점을 맞추며, 이로 인해 모델의 추론 과정이 방해받고 단계별 행동의 일관성을 유지하기 어려운 문제를 해결합니다.

작동 방식

ARPO (에이전트 강화 정책 최적화)

ARPO는 엔트로피가 높은 도구 호출 라운드에서 정책 모델이 적응적으로 "분기 샘플링"을 수행하도록 유도합니다. 이는 모델이 가장 불확실할 때 더 효과적으로 여러 가능한 추론 경로를 탐색할 수 있게 하여 도구 사용 행동의 일관성을 향상시킵니다.

AEPO (에이전트 엔트로피 균형 정책 최적화)

AEPO는 이러한 개념을 확장하여 두 단계에서 엔트로피를 균형 있게 조절합니다.

  • 롤아웃 단계: 동적 엔트로피 균형 롤아웃 메커니즘을 사용하여 샘플링 예산을 배분하고, 연속된 고엔트로피 단계에서의 과도한 분기를 방지하기 위한 페널티를 적용합니다.
  • 업데이트 단계: 엔트로피 균형 정책 최적화를 사용하며, 정지 기울기 연산(엔트로피 클리핑-균형 메커니즘)을 통해 고엔트로피 토큰의 기울기를 보존하고, 엔트로피 인식 아드밴티지 추정을 활용해 높은 불확실성 토큰에 학습을 우선시합니다.

대상 사용자

이 프로젝트는 Qwen이나 Llama 모델과 같은 LLM 기반 에이전트를 복잡한 추론과 자율적인 도구 상호작용을 수행할 수 있도록 다단계 환경에서 훈련하는 AI 연구자 및 개발자에게 적합합니다.

주요 특징

  • 성능 향상: GAIA 및 HLE와 같은 벤치마크에서 높은 점수를 기록 (예: Qwen3-14B는 GAIA에서 61.2% 달성).
  • 효율성: GRPO에 비해 훈련 중 필요한 도구 호출 횟수를 크게 줄였습니다.
  • 최적화: 도구 호출 가속 및 메모리 최적화를 포함하여, 단일 노드에서 배치 크기 128로 14B 모델을 1단계당 10분 내에 훈련할 수 있습니다.
  • 포괄적인 리소스: 완전한 코드베이스, SFT 및 RL 데이터셋, 3B에서 32B 파라미터까지의 사전 학습 모델 체크포인트를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트