NVIDIA Nemotron 3 Ultra 출시
NVIDIA Nemotron 3 Ultra는 복잡하고 장시간 실행되는 에이전트 워크플로우를 위한 오픈 모델로, 수백 번의 도구 호출을 포함한 작업에서 높은 정확도와 비용 효율성을 제공합니다. 이제 Ollama의 클라우드에서 사용 가능해 개발자들이 에이전트 오케스트레이션, 코드 에이전트, 심층 연구 파이프라인에 쉽게 통합할 수 있습니다.
모델 아키텍처 및 효율성
Nemotron 3 Ultra는 총 5500억 파라미터를 가진 전문가 혼합(Mixture-of-Experts, MoE) 아키텍처를 사용하지만, 토큰당 활성화되는 파라미터는 550억에 불과합니다. 이 설계는 계산 오버헤드를 줄이면서도 최첨단 수준의 추론 능력을 유지할 수 있게 해줍니다.
성능과 메모리 사용량을 더욱 최적화하기 위해, 모델은 NVIDIA의 4비트 부동소수점 형식인 NVFP4에 최적화되어 있습니다. 이 양자화 기법은 모델을 더 적은 메모리에 패킹하고, 표준 형식보다 빠르게 실행할 수 있게 해줍니다.
긴 컨텍스트 및 에이전트 기능
Nemotron 3 Ultra는 수백 단계에 걸친 에이전트 오케스트레이션과 기업 워크플로우에 특화되어 있습니다. 주요 기능은 다음과 같습니다:
- 100만 토큰 컨텍스트 창: 모델은 전체 코드베이스, 광범위한 도구 기록, 심층 연구 흐름을 컨텍스트 창 내에서 일관성 손실 없이 유지할 수 있습니다.
- 에이전트 전용 최적화: 코드 에이전트, 심층 연구, 고정밀 지시 수행과 다수의 도구 호출이 필요한 복잡한 워크플로우에 최적화되어 있습니다.
성능 및 비용 벤치마크
NVIDIA와 Ollama에 따르면, Nemotron 3 Ultra는 에이전트 생산성, 코드 작성, 지시 수행 벤치마크에서 오픈 모델 중 가장 높은 정확도를 기록하고 있습니다.
운영 효율 측면에서 모델은 높은 처리량과 비용 효율성을 보여줍니다. 다른 주요 오픈 모델 대비 최대 30%의 비용 절감 효과를 보이며, 비용 효율성 선두 주자에 위치해 있습니다.
배포 및 통합
Nemotron 3 Ultra는 Ollama의 클라우드를 통해 배포할 수 있습니다. 여러 에이전트 도구와의 통합을 지원하며, 다음과 같은 예시가 있습니다:
- Claude Code:
ollama launch claude --model nemotron-3-ultra:cloud - Hermes Agent:
ollama launch hermes --model nemotron-3-ultra:cloud - OpenClaw:
ollama launch openclaw --model nemotron-3-ultra:cloud - 일반 채팅:
ollama run nemotron-3-ultra:cloud
Sources
- OriginalNVIDIA Nemotron 3 Ultra
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch