Laguna S 2.1 릴리즈 노트: 고성능 에이전트 코딩 모델
Laguna S 2.1 릴리즈 노트: 고성능 에이전트 코딩 모델
Laguna S 2.1은 장기 에이전트 작업과 복합 추론을 위해 설계된 118B 전체 파라미터 Mixture-of-Experts (MoE) 모델입니다. 토큰당 8B만 활성화된 파라미터로도 코딩 벤치마크에서 여러 배 큰 모델과 경쟁할 수 있는 성능을 보여, NVIDIA DGX Spark와 같은 로컬 머신 및 특수 워크스테이션에 배포하기에 최적화되었습니다.
성능 벤치마크 및 모델 효율성
Laguna S 2.1은 에이전트 코딩 작업에서 무게 등급을 크게 뛰어넘는 효율성을 입증합니다. 사고 모드에서는 Terminal‑Bench 2.1에서 70.2% 점수를 기록해 DeepSeek‑V4‑Pro‑Max (1.6T)와 Inkling (975B) 등 여러 대형 오픈‑웨이트 모델을 앞섭니다.
비교 벤치마크 결과
| Benchmark | Laguna S 2.1 (118B‑A8B) | Tencent Hy3 (295B‑A21B) | DeepSeek‑V4‑Pro Max (1.6T‑A49B) | Kimi K3 (2.8T‑A50B) | Claude Fable 5 |
|---|---|---|---|---|---|
| Terminal‑Bench 2.1 | 70.2 | 71.7 | 64.0 | 88.3 | 88.0 |
| SWE‑Bench Multilingual | 78.5 | 75.8 | 76.2 | - | - |
| SWE‑Bench Pro (Public) | 59.4 | 57.9 | 55.4 | - | 80.3 |
| DeepSWE | 40.4 | - | 9.0 | 69.0 | 70.0 |
| SWE Atlas (Codebase QnA) | 46.2 | - | 27.2 | - | - |
| Toolathlon Verified | 49.7 | - | 55.9 | - | - |
DeepSWE v1.1 벤치마크—부분 해결이 어려운 장기 과제들을 포함—에서 Laguna S 2.1은 사고 모드에서 40.4% 점수를 기록했습니다. 이는 동일 벤치마크에서 9.0%를 기록한 1.6T 파라미터 DeepSeek‑V4‑Pro‑Max보다 현저히 높은 결과입니다.
핵심 역량 및 사례 연구
Laguna S 2.1은 끈기와 자원 활용 능력이 뛰어나, 직접적인 방법이 실패할 경우 대안을 찾아 목표를 달성합니다.
브라우저 엔진 구축
50분, 181단계 세션 동안 인간 개입 없이 모델은 빈 폴더에서 작동하는 HTML/CSS 렌더링 엔진을 구축했습니다. 시각 인식 능력이 부족한 점을 보완하기 위해, 모델은 헤드리스 Chromium을 이용해 캔버스를 읽고 실제 브라우저와 스크린샷을 수치적으로 비교하는 검증 루프를 구현했습니다.
자동 하네스 최적화
Poolside 자체 에이전트 하네스 최적화 작업에서 Laguna S 2.1은 5.2% 속도 향상과 약 70% 메모리 할당 감소를 달성했습니다. 모델은 스트리밍‑토큰 누적 과정에서 $O(n^2)$ 문자열 연결을 발견하고 이를 버퍼로 교체했으며, 궤적 물리화 과정에서 중복 복사를 제거했습니다.
수학적 발견
모델은 2026년 1월까지 50년 넘게 미해결 상태였던 Erdős 문제 #397의 증명을 독립적으로 재구성했습니다. 모델의 지식 컷오프가 2025년 11월이므로 완전 새로운 도출이었습니다. 모델은 샌드박스 내 Perl을 활용해 무차별 소인수분해와 패턴 분석을 수행해 8‑인덱스 해의 무한 가족을 닫힌 형태로 찾았습니다.
기술 아키텍처 및 학습
Laguna S 2.1은 9주 미만의 기간에 Laguna XS 계열을 기반으로 동일한 사전 학습 데이터를 사용해 개발되었습니다.
사후 학습 및 RL
모델의 에이전트 역량 대부분은 두 단계 사후 학습 과정에서 비롯됩니다: 합성 데이터를 이용한 SFT 단계와 어려운 작업을 위한 강화 학습(RL) 단계. RL은 학습 속도 향상을 위해 FP8 정밀도로 수행되었습니다. 학습 코퍼스는 409k 환경을 포함했으며, 그 중 168k는 소프트웨어 엔지니어링 워크플로우, 83k는 터미널 사용 사례를 목표로 했습니다.
사고 모드와 컨텍스트
모델은 최대 1M 토큰의 컨텍스트 윈도우를 지원하며 두 가지 사고 모드를 제공합니다:
- Off: 표준 생성.
- Max (Default): 모델이 최적의 테스트‑타임 연산 예산을 결정합니다.
"Max" 사고를 활성화하면 성능이 크게 향상되어 Terminal‑Bench 2.1 점수가 60.4%에서 70.2%로, DeepSWE 점수가 16.5%에서 40.4%로 상승합니다.
알려진 제한 사항
- 하네스 과적합: 모델이 자체 하네스의 도구 인터페이스 기억에 의존해 제3자 하네스의 스키마를 따르지 않을 수 있습니다.
- 중첩 도구 호출: 도구 인수가 JSON 배열을 필요로 할 때 잘못 이스케이프되거나 유효하지 않은 JSON을 생성하는 경우가 있습니다.
- 과도한 사고: 경쟁 수학과 같은 특정 분야에서는 진행하기 전에 지나치게 긴 사고 시퀀스를 생성할 수 있습니다.
커뮤니티 인사이트 및 배포
커뮤니티 피드백은 이 모델이 가정용 하드웨어에서도 충분히 활용 가능하며 DeepSeek V4 Flash와 같은 대형 모델과 경쟁력이 있음을 강조합니다. 사용자들은 "thinking"을 활성화하고 max_new_tokens를 (기본 generation_config.json의 32k를 넘어) 늘리는 것이 보고된 코드 품질을 얻는 데 핵심이라고 언급했습니다.
Laguna S 2.1은 Hugging Face에서 OpenMDW‑1.1 라이선스로 BF16, FP8, INT4, NVFP4 가중치와 함께 제공됩니다. 로컬 추론을 위해 vLLM, SGLang, Ollama가 지원됩니다.