Inception Labs Mercury 2.5 릴리스: 더 빠르고 저렴한 260K 컨텍스트를 갖춘 확산 기반 LLM
Mercury 2.5는 저지연 확산 기반 언어 모델의 기준을 높입니다
핵심 포인트: Inception Labs의 Mercury 2.5는 Mercury 2보다 40% 더 높은 지능을 제공하며, 일반적인 NVIDIA GPU에서 초당 1,107토큰의 처리 속도, 최대 260K 토큰의 컨텍스트를 지원하고, 출시 가격은 입력 토큰당 $0.04로, 현재 시장에서 가장 빠르고 저렴한 생산 수준의 확산 기반 LLM입니다.
Mercury 2에 비한 핵심 개선 사항
- 품질: Inception Labs는 "지능"이 40% 향상되었다고 주장하며, Mercury 2.5는 GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5와 같은 비용 최적화된 최첨단 모델과 비슷한 수준에 도달했습니다.
- 속도: 벤치마크 결과에 따르면, 널리 사용 가능한 NVIDIA GPU에서 초당 1,107토큰을 처리할 수 있으며, 커뮤니티 사용자들은 응답이 "이상할 정도로 빠르다"고 묘사하며 이 수치를 반복적으로 확인했습니다.
- 컨텍스트 창: 모델은 최대 260K 토큰까지 지원하여 매우 긴 형식의 상호작용과 광범위한 검색 기반 생성(RAG) 파이프라인을 가능하게 합니다.
- 가격: 표준 출시 가격은 입력 토큰당 $0.20, 출력 토큰당 $0.75입니다. 초기 할인 혜택으로 80% 할인을 적용하면 입력 토큰당 $0.04, 출력 토큰당 $0.15로 가격이 낮아집니다.
- 새로운 기능: 조정 가능한 추론, 병렬 도구 호출, 스키마 일치 JSON 출력은 복잡한 에이전트 워크플로우에 적합합니다.
"Mercury 2.5는 시장에서 가장 강력한 확산 기반 LLM입니다. 저희 지식으로는 지금까지 훈련된 가장 큰 확산 언어 모델입니다." – Inception Labs 블로그
실제 생산 환경 적용 사례
검색 에이전트 및 RAG 파이프라인
- Mercury 2.5는 한 번의 사용자 상호작용 내에서 쿼리 재작성, 재정렬, 사실 구조화, 요약, 답변 검증 등 수십 번의 모델 호출을 처리할 수 있습니다.
- 사용자들은 여러 추론 단계가 필요한 경우에도 모델의 지연 시간이 엔드투엔드 검색 경험을 원활하게 유지한다고 보고했습니다.
음성 에이전트
- OpenCall의 AI 전화 에이전트는 실제 트래픽에서 중간 모델 응답 지연 시간이 약 170ms를 기록했습니다.
- Mercury 2.5로 전환한 후, OpenCall의 P99 지연 시간은 분 단위에서 1초로 감소했으며, P50 지연 시간은 0.4초에서 0.2초 미만으로 떨어졌고, 경쟁 제공업체를 능가했습니다.
"통화 중 사용자가 듣는 짧은 휴지 시간이 바로 지연 시간인데, Mercury 2.5는 그 휴지 시간을 거의 무시할 수 있게 만들었습니다." – Oliver Silverstein, OpenCall CEO
코드 서브에이전트 및 보조 도구
- Augment Code는 Mercury 2.5를 사용해 컨텍스트 압축과 도구 검색을 수행합니다. 압축 지연 시간은 82% 감소 (150초 → 27초)했고, 비용은 90% 감소하면서도 품질은 유지되었습니다.
- 모델은 몇 개의 프롬프트만으로 1초 이내에 완전한 웹 앱을 생성할 수 있어, 빠른 프로토타이핑에 적합함을 보여줍니다.
Hacker News 커뮤니티 피드백
| 댓글 작성자 | 통찰 / 비판 | 관련성 |
|---|---|---|
| networked | IP 보호 가드레일이 거부 메시지를 반환했지만, 모델은 회복하여 작업을 완료했습니다. | 저수준 디버깅에 방해가 될 수 있는 내장 안전 필터를 강조합니다. |
| Sphax | "널리 사용 가능한 GPU"라는 주장에 따라 오픈웨이트 릴리스를 기대했지만, 모델은 여전히 폐쇄 소스입니다. | 개발자들의 라이선스 기대를 명확히 합니다. |
| gertlabs | Mercury 2.5 프리뷰를 테스트했으며, 일반 목적 채팅에서는 오래된 오픈웨이트 모델과 유사하지만, 도구 사용 및 에이전트 기반 코딩 성능은 약하다고 지적했습니다. | 최첨단 모델과의 성능 비교를 균형 있게 평가합니다. |
| irthomasthomas | 고토큰 처리량(초당 1.1K 토큰)이 LLM 협회에서 다중 모델 심사 시스템의 지연 부담을 완화할 수 있음을 지적했습니다. | 앙상블 아키텍처에 대한 전략적 이점을 보여줍니다. |
| mrinterweb | 속도만으로는 충분하지 않으며, 정확성이 원초적인 처리량보다 더 중요하다고 주장합니다. | 품질 대 속도의 트레이드오프를 상기시킵니다. |
| schopra909 | 확산 기반 모델이 이산 토큰 생성에 이론적 한계가 있음을 논의하며, 향후 하이브리드 "루프형" 확산 접근 방식을 제안합니다. | Mercury 2.5가 확산 기반 LLM 연구의 전반적인 트렌드 속에 위치함을 보여줍니다. |
| piterrro | Mercury 2.5를 벡터 스토어 결과의 이진 재정렬기로 사용하며, 속도와 결정론적 출력 형식을 칭찬합니다. | 저지연 검색의 실용적인 사용 사례를 보여줍니다. |
| trefoiled | OpenRouter에서의 경험을 "이상할 정도로 빠르다"고 묘사하며, 벤치마크 수치를 확인했습니다. | 토큰당 초당 수치에 대한 사례 기반 검증입니다. |
전반적인 감정: 사용자들은 속도와 가격에 인상받았지만, 추론 정확도와 도구 사용은 최첨단 모델에 비해 여전히 뒤처지고 있음을 지적했습니다.
Mercury Voice 및 Mercury Router 프리뷰
- Mercury Voice: 음성 보조기능에 최적화된 확산 기반 LLM으로, 첫 토큰까지의 시간 <170ms를 제공합니다.
- Mercury Router: 입력 프롬프트를 분류하고, 품질, 속도, 비용을 고려해 가장 적합한 모델(오픈 소스 또는 폐쇄 소스)으로 라우팅하는 dLLM입니다.
이 프리뷰들은 Mercury 생태계를 순수 텍스트 생성을 넘어서 실시간 음성 상호작용과 다중 모델 오케스트레이션에까지 확장합니다.
시작하기
- API 접근: Inception API, Baseten, OpenRouter 모두 Mercury 2.5를 제공합니다.
- 무료 티어: 체험을 위한 1억 토큰이 제공됩니다.
- 엔터프라이즈: 전용 용량, 자동 스케일링, 준수 제어, 사용자 정의 데이터 보존 기능이 제공됩니다.
- YC 혜택: Y Combinator 기업은 50만 달러의 배포 크레딧을 신청할 수 있습니다.
전망
Inception Labs는 현재 더 큰 확산 모델을 훈련 중이며, 향후 몇 달 내에 출시될 예정입니다. 이 모델은 속도나 토큰 효율성을 희생하지 않고도 추가적인 능력을 제공할 것으로 기대됩니다. 회사는 확산 기반 LLM 기술 발전에 관심 있는 기여자를 환영합니다.
결론
Mercury 2.5는 확산 기반 언어 모델이 최첨단 수준의 토큰 처리 속도를 달성하면서도, 비용 효율적이고 저지연한 생산 워크로드(검색, 음성, 코드 보조 도구 등)에 적합함을 입증했습니다. 출시 후 긍정적인 반응을 얻었으며, 속도와 가격이 강점이지만 커뮤니티 피드백은 추론 정확도와 도구 사용 측면에서 여전히 최신 프로피리터 모델과 경쟁하기 위해 개선이 필요하다고 지적하고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch