Holo4 27B 및 35B-A3B 에이전트 모델 출시

TL;DR

Hugging Face는 Holo4 시리즈를 출시했습니다. 이는 그래픽 사용자 인터페이스(GUI), 코드 실행, MCP 및 API 전반에서 작동할 수 있는 27B 밀집 모델과 35B-A3B 전문가 혼합(Mixture-of-Experts) 모델로, 비교 가능한 최첨단 모델보다 훨씬 저렴한 비용으로 학술 벤치마크에서 경쟁력 있는 점수를 제공합니다.


모든 인터페이스에 걸친 통합 에이전트 기능

Holo4는 필요에 따라 클릭, 타이핑, 코드 작성, 코드 실행, MCP 또는 API 도구 호출을 수행하도록 설계되었습니다. 단일 상호작용 모드에 특화된 대부분의 에이전트 모델과 달리, Holo4는 각 하위 작업에 가장 적합한 인터페이스를 사용하여 GUI 작업, 도구 호출 및 코드 실행을 혼합하는 실제 비즈니스 워크플로우를 처리할 수 있습니다. 동일한 모델을 모델 전환 없이 데스크톱, 웹 브라우저, Android 기기, 코드 샌드박스 및 비즈니스 API에 배포할 수 있습니다.


저비용의 경쟁력 있는 벤치마크 성능

Holo4는 Qwen 베이스를 기반으로 하며 상당한 개선을 보여줍니다. OSWorld 2.0 벤치마크에서 27B 버전은 61.7%(폐쇄형 Opus 5.5의 경우 81.8%)를 기록했고, 35B-A3B 버전은 **30.9%**에 도달했습니다. 절대 점수는 낮지만, Holo4는 훨씬 적은 파라미터와 작업당 훨씬 낮은 비용으로 이러한 결과를 달성합니다. OSWorld 2.0 및 AutomationBench에 대한 비용-성능 차트는 H Models API의 Holo4 토큰 기반 가격 책정이 Qwen 3.8 27B, Qwen 3.6 35B-A3B 및 주요 폐쇄형 모델보다 저렴함을 보여줍니다.


실제 전문 소프트웨어 작업

Holo4는 내부 Agentic Task Factory에서 생성된 약 10,000개의 작업을 통해 학습되었으며, 웹 앱, MCP 서버 및 데스크톱 환경을 다룹니다. Qwen 3.8 27B 베이스 모델과의 일대일 비교에서 Holo4는 다음과 같은 복잡한 작업을 완료하는 데 일관되게 더 적은 호출과 더 적은 토큰을 필요로 했습니다:

  • FreeCAD에서 에펠탑 3D 모델링 – 84회 호출 / 1.3M 토큰 (Holo4) vs. 60회 호출 / 1.0M 토큰 (Qwen).
  • FreeCAD에서 H-company 로고 생성 – 94회 호출 / 1.5M 토큰 (Holo4) vs. 118회 호출 / 1.9M 토큰 (Qwen).
  • Godot에서 팩맨 스타일 게임 제작 – 68회 호출 / 2.4M 토큰 (Holo4) vs. 197회 호출 / 11.4M 토큰 (Qwen).

이러한 예시는 GUI 상호작용, 코드 생성 및 실행을 단일하고 일관된 워크플로우로 조정하는 Holo4의 능력을 보여줍니다.


학습 파이프라인 및 하니스 개선

Agentic Task Factory는 문서를 스크린샷과 함께 대화형 환경 및 검증 가능한 작업으로 변환하여 학습 데이터를 생성했습니다. Holo4는 **127B 토큰에 대한 지도 미세 조정(SFT)**을 거친 후, 두 개의 전문가 RL 정책으로부터 강화 학습을 수행하고 단일 모델로 병합되었습니다. 모델 학습과 병행하여 팀은 수백 단계에 걸쳐 컨텍스트를 관리하는 실행 루프인 *하니스(harness)*를 재구축했습니다. 주요 하니스 업그레이드는 다음과 같습니다:

  • 수백 단계를 추적할 수 있는 신뢰할 수 있는 메모리 시스템.
  • 데스크톱 머신에 대한 직접적인 셸 액세스.
  • 에이전트가 실패를 태그하고 엔지니어가 수정 사항을 검토하는 OSWorld 2.0 실행으로부터의 지속적인 피드백.

Holotron4 Nano: Nemotron 3 Nano Omni로 레시피 확장

동일한 사후 학습 스택을 NVIDIA Nemotron 3 Nano Omni 모델에 적용하여 30B-A3B 에이전트 모델인 Holotron4 Nano를 제작했습니다. 5개 작업에 걸친 벤치마크 결과, 베이스 Nemotron 모델 대비 절대 백분율 포인트 상승을 보여주었으며, 이는 해당 레시피가 모델 크기와 아키텍처 전반에 걸쳐 일반화됨을 확인시켜 줍니다.


가용성 및 다음 단계

두 Holo4 변형 모델 모두 H Models API에서 사용할 수 있습니다. 모델 가중치는 Hugging Face에 BF16, FP8, NVFP4 및 4-bit GGUF 형식으로 호스팅되며, 더 작은 Holotron4 Nano도 함께 제공됩니다. 팀은 추론 속도를 더욱 높이기 위해 최적화된 DSpark 드래프터 체크포인트를 곧 출시할 예정입니다.


리소스

Sources