Holotron-12B 고처리량 컴퓨터 사용 에이전트

H Company는 Holotron-12B를 출시했으며, 이는 컴퓨터 사용 에이전트를 위한 정책 모델로 특별히 설계된 멀티모달 모델입니다. NVIDIA Nemotron-Nano-2 VL 모델을 자체 데이터 혼합으로 사후 학습함으로써, H Company는 인터랙티브 환경 내에서 효율적으로 인지하고, 결정하며, 행동할 수 있는 에이전트를 개발했으며, 생산 규모와 성능을 최적화했습니다.

하이브리드 SSM 아키텍처를 통한 고처리량

Holotron-12B는 하이브리드 상태공간 모델(State-Space Model, SSM)과 어텐션 메커니즘을 활용하여 높은 추론 효율성을 달성합니다. 이 아키텍처는 고처리량 서비스를 위해 특별히 최적화되었으며, 순수 트랜스포머 기반 모델에 비해 여러 장점을 제공합니다:

  • 메모리 사용량 감소: Vanilla 어텐션과 달리 토큰 및 레이어당 KV 활성화를 저장해야 하는 KV 캐시가 필요하지만, SSM은 선형 순환 모델로서 시퀀스 길이에 관계없이 생성된 시퀀스당 레이어당 일정한 상태만 저장합니다.
  • 선형 확장성: 전체 어텐션에 수반되는 2차 연산 비용을 피하도록 설계되어, 다중 고해상도 이미지와 방대한 상호작용 기록을 포함하는 장기 컨텍스트 추론에 더 효율적입니다.
  • 처리량 증가: 단일 H100 GPU와 vLLM (v0.14.1)을 사용한 WebVoyager Benchmark 테스트에서 Holotron-12B는 Holo2-8B보다 2배 이상의 처리량을 달성했습니다.

제어된 실험에서 Holotron-12B의 총 토큰 처리량은 최대 동시성 100에서 8.9k 토큰/초까지 꾸준히 상승했으며, Holo2-8B는 5.1k 토큰/초에서 정체되었습니다. 이는 VRAM 활용이 더 효율적이고 메모리 사용량이 적어 동일한 하드웨어에서 더 큰 유효 배치 크기를 허용함을 보여줍니다.

학습 방법론 및 데이터

Holotron-12B는 NVIDIA Nemotron-Nano-12B-v2-VL-BF16 멀티모달 기본 모델을 시작점으로 두 단계에 걸쳐 개발되었습니다. 모델은 H Company의 독점적인 로컬라이제이션 및 내비게이션 데이터 혼합을 사용해 감독 학습 미세조정을 거쳤으며, 이는 세 가지 주요 영역에 초점을 맞추었습니다:

  1. 화면 이해
  2. 그라운딩
  3. UI 수준 상호작용

최종 체크포인트는 약 140억 토큰으로 학습되었습니다.

성능 벤치마크

Holotron-12B는 기본 Nemotron 모델에 비해 상당한 개선을 보이며, 여러 주요 벤치마크에서 기존 에이전트 모델과 경쟁력 있는 성능을 나타냅니다.

에이전트 성능

WebVoyager 벤치마크에서 Holotron-12B의 성능은 35.1% (기본 Nemotron)에서 80.5%로 상승했으며, Holo2-8B의 성능을 초과했습니다.

로컬라이제이션 및 그라운딩

모델은 또한 로컬라이제이션 및 그라운딩 벤치마크에서 기본 Nemotron 모델에 비해 상당한 개선을 보여주었으며, 다음을 포함합니다:

  • OS-World-G
  • GroundUI
  • WebClick

향후 전망: Nemotron 3 Omni

Holotron-12B의 결과를 바탕으로, H Company는 Nemotron 3 Omni 아키텍처를 사용한 차세대 멀티모달 모델을 사후 학습할 준비를 하고 있습니다. 이 차세대 모델은 향상된 하이브리드 SSM-Attention 및 전문가 혼합(Mixture-of-Experts, MoE) 기반을 활용하여 추론 능력, 멀티모달 정밀도 를 개선하고, 대규모 자동화 컴퓨터 사용 배포에 필요한 저지연 성능을 제공할 것입니다.

Sources