inclusionAI/AReno

An easy-to-use, fast toolkit to scale up RL post-training on a single node.

해결하는 문제

AReno는 LLM 강화학습(RL) 및 포스트 트레이닝을 사용하기 쉽게 만들기 위해 자체 완전한 단일 노드 툴킷을 제공하도록 설계되었습니다. 복잡한 클러스터 설정, 별도의 추론 서버, 또는 분산된 트레이닝 프레임워크가 필요 없으며, 개발자가 한 대의 머신에서 베이스 모델 체크포인트에서 시작하여 트레이닝된 모델을 바로 배포할 수 있습니다.

작동 방식

AReno는 단일 노드 성능에 최적화된 풀스택 설계를 사용합니다. Trainer 클래스와 CLI를 제공하여 RL 루프 전체를 처리합니다: 온폴리시(rollout) 완성 생성, 사용자 정의 보상 함수를 통한 점수 매기기, 모델 가중치 업데이트(트레이닝). CUDA(Linux) 및 MLX(Apple Silicon) 백엔드를 네이티브로 지원합니다.

대상 사용자

대규모 인프라스트럭처를 관리할 필요 없이, RL, SFT, 또는 DPO 스타일 트레이닝을 통해 빠르고 로컬에서 LLM의 포스트 트레이닝을 수행하고자 하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 즉시 사용 가능: 간단한 --algo 플래그 또는 Python API를 통해 다양한 포스트 트레이닝 알고리즘에 접근 가능.
  • 에이전트 기반 RL 대응: 로컬 OpenAI 호환 프록시와 상호작용하며 트래잭토리에서 학습 가능한 에이전트 트레이닝 지원.
  • 다중 모달리티 지원: OpenAI 스타일 메시지 포맷을 사용해 이미지, 오디오, 비디오 콘텐츠와 호환.
  • 하드웨어 유연성: NVIDIA GPU는 CUDA, Apple Silicon은 MLX로 네이티브 지원.
  • 통합 서빙: 연속 배치 처리를 지원하는 내장형 OpenAI 호환 서버를 포함하여 트레이닝된 모델을 즉시 배포 가능.
  • 운영 에이전트: 사용자가 트레이닝 명령어를 설정하고 실행하는 데 도움을 주는 내장형 AI 어시스턴트(areno agent) 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트