Cognition SWE-2 릴리스: 성능, 비용, 훈련 혁신
SWE-2는 코딩 에이전트의 파레토 경계를 한층 더 밀어냄
Cognition의 새로운 SWE-2 모델은 FrontierCode 1.1 Main 벤치마크에서 50.0%의 해결률을 달성했으며, 선두인 Fable 5.1과 단 1점 차이에 그치면서도 실행 비용이 64% 낮습니다. 이 결과는 단일 모델이 다양한 노력 수준에서 비용-성능 트레이드오프 곡선을 동시에 우월하게 다룰 수 있음을 보여줍니다.
주요 성능 수치 (높을수록 좋음, 별도 표기 시 제외)
| 벤치마크 | SWE‑2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT‑5.6 Sol | GPT‑6 Astra | SWE‑1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0 % | 44.2 % | 48.0 % | 50.9 % | 47.5 % | 53.3 % | 42.0 % |
| DeepSWE 1.1 | 73.0 % | 68.5 % | 67.5 % | 67.4 % | 72.7 % | 74.1 % | 37.7 % |
| Terminal‑Bench 2.1 | 92.8 % | 88.3 % | 88.4 % | 91.4 % | 88.8 % | 89.9 % | 81.5 % |
| Terminal‑Bench 4 | 27.3 % | 21.5 % | 20.3 % | 55.8 % | 37.3 % | 57.9 % | 7.6 % |
SWE‑2는 모든 벤치마크에서 이전 모델인 SWE‑1.7를 능가하며, 점수와 비용 면에서 Grok 4.6를 모두 앞섭니다. GPT‑5.6 Sol과 Fable 5.1과 비슷한 성능을 낼 수 있었지만 비용은 그들의 몫의 일부에 불과했으며, GPT‑6 Astra와는 몇 포인트 차이로 근접하면서도 비용은 그의 1/4에 불과했습니다.
SWE-2가 더 높은 지능과 낮은 비용을 동시에 달성하는 방법
1. 단일 RL 실행에서 파레토 정보 기반의 비용 페널티
- 선형 비용 페널티 – 보상 함수는
R = S – λₑ·C로 정의되며, 여기서S는 이진 성공 여부,C는 롤아웃 비용,λₑ는 노력 수준e에 대한 기준 모델의 비용-성능 곡선의 국소 기울기에 맞춰 조정됩니다. - 왜 선형인가? – 증명(부록 B)에 따르면, 오직 아핀 페널티만이 보상의 기대값이 롤아웃 분포에 관계없이 평균 비용과 해결률에만 의존하도록 보장합니다.
- 기울기 일치 –
λₑ를 경계선의 기울기와 동일하게 설정하면 등보상선이 파레토 곡선에 접하게 되어, 보상 증가 시 경계선이 외부로 확장됨을 보장합니다.
“λₑ를 m(국소 기울기)로 설정하면 목적함수가 파레토 곡선을 따라 움직이는 것에 영향을 받지 않으므로, 개선은 직접적으로 경계선을 상향 이동시킵니다.” – Cognition 블로그
2. 길이 가중 보상 기준선
- 기준선
b̂ = Σ Rᵢ·Lᵢ / Σ Lᵢ(롤아웃 길이에 따라 보상 가중)는 추가 역전파 없이도 최적의 분산 감소 기준선을 근사합니다. - 실증적 분석 결과, 추론 정책과 훈련 정책 간의 KL 발산이 크게 감소하여 RL의 안정성이 향상되었습니다.
3. RL 롤아웃 서빙 및 사전 디코딩
- DSpark 사전 디코딩 – 드래프트 모델이 토큰을 제안하고 정책 모델이 이를 검증함으로써 처리량이 10~20% 증가합니다.
- SpecForge 훈련 드래프트 – 수락된 토큰 길이를 약 15% 늘리며, 정책의 변화를 실시간으로 추적하기 위해 온라인으로 업데이트됩니다.
- 저정밀도 MoE 추론 – NVFP4/FP8 커널과 정량화 인식 훈련을 통해 메모리 사용량은 낮추면서도 KL 일치는 유지합니다.
4. 데이터 규모 확대 및 검증기 강화
- RL 환경 수를 3배로 늘리고 저장소 출처를 확장했습니다.
- 여러 동시 지시사항을 처리하면서도 모델이 과제에 집중하도록 지시어 따르기 오버레이를 추가했습니다.
- 재귀적 플라이휠 구현: 중간 체크포인트에서의 롤아웃 결과를 활용해 검증기 실패를 탐지하고 패치함으로써 보상 조작을 줄였습니다.
SWE-2에서 관찰된 행동적 개선점
- 집중된 탐색 – 첫 번째 수정이 평균 18단계 후에 발생 (SWE-1.7의 48단계 대비), 탐색 오버헤드가 62% 감소했습니다.
- 테스트 커버리지 – 더 포괄적인 엔드투엔드 테스트를 생성하여 회귀를 조기에 포착합니다.
- 자원 활용 능력 – 필요한 통합이 없을 경우 기존 컨텍스트(예: Slack 기록)에서 필요한 데이터를 재구성할 수 있습니다.
- 검증의 철저함 – 도전을 받을 경우 결론을 재추론하고 증거 수집 도구를 실행하며 맹목적인 동의를 피합니다.
- 노력 수준 차별화 – 중간 노력은 간단/중간 수준 과제에서 낮은 비용으로 뛰어난 성능을 보이며, 고 및 최대 노력은 복잡한 문제에 대해 더 많은 계획과 검증을 할당합니다.
신뢰성 평가
Cognition는 SWE-2를 포함한 6개 모델에 대해 내부의 선전/검열 및 컨텍스트 기반 취약성 테스트를 재실행했습니다. 결과는 다음과 같습니다:
- 선전 및 검열 – SWE-2는 전체적으로 98.0% 통과 (영어 99.8%, 간체중국어 95.2%, 번체중국어 99.1%)
- 컨텍스트 기반 취약성 – 어떤 모델에도 통계적으로 유의미한 프레임 효과 없음; SWE-2의 평균 취약성 변화는 거의 0에 가까워 동료 모델과 유사함.
Hacker News 커뮤니티 반응
- 벤치마크 일반화에 대한 회의론 – 상위 댓글은 Terminal-Bench 2.1(92.8%)과 Terminal-Bench 4(27.3%) 사이의 큰 격차를 "벤치마크 최적화"의 증거로 지적했습니다.
- Kimi K3 후 훈련에 대한 우려 – 일부 사용자는 성능 향상이 강력한 K3 기반 모델에서 유래한 것인지, 아니면 새로운 공학적 혁신인지에 대해 의문을 제기했습니다.
- 오픈웨이트 대 폐쇄웨이트 논쟁 – 여러 댓글에서 SWE-2가 오픈웨이트로 출시될지, DeepSeek Flash 4.1과 같은 모델들과 비교될지 묻고 있습니다.
- 제품 경험 – 혼합된 평가: 일부 사용자는 이전의 SWE-1.7를 사용 불가능하다고 평가했지만, 다른 사용자는 SWE-2의 UI인 Devin이 풀리퀘스트 자동화에서 생산성을 향상시킨다고 보고했습니다.
- 가용성 – 현재 모델은 Cognition의 Devin 데스크톱, CLI, 웹 및 Fusion 플랫폼을 통해 접근 가능하며, 오픈라우터나 제3자 API 통합은 공지되지 않았습니다.
릴리스가 코딩 에이전트 생태계에 미치는 의미
- 비용-성능 우월성 – SWE-2는 단일의 다중 노력 수준 RL 훈련 모델이 동시에 최상위 해결률과 상당히 낮은 작업당 비용을 달성할 수 있음을 보여줍니다.
- 방법론적 기여 – 파레토 정보 기반의 선형 비용 페널티는 다양한 사용자 예산을 충족시키는 모델을 훈련하는 원칙적이고 재현 가능한 방법을 제공합니다.
- 광범위한 채택 가능성 – Cognition가 가중치를 공개하거나 경쟁력 있는 API 가격을 제공한다면, SWE-2는 Fable 5.1이나 GPT-6 Astra와 같은 사내 에이전트의 실질적인 대안이 될 수 있습니다.
- 남은 질문들 – 커뮤니티는 제시된 벤치마크를 넘어서 실제 세계에서의 일반화 능력과 모델의 오픈성에 대해 여전히 불확실한 상태입니다.
참고문헌
- Lu et al., FrontierCode 1.1, July 2026. https://cognition.com/blog/frontier-code-1.1
- Pan et al., SWE‑1.7: Frontier Intelligence at a Fraction of the Cost, July 2026. https://cognition.com/blog/swe-1-7
- Kimi Team, Kimi K3: Open Frontier Intelligence, arXiv:2607.24653, July 2026. https://arxiv.org/abs/2607.24653
- Kool et al., Buy 4 REINFORCE Samples, Get a Baseline for Free!, ICLR 2019 workshop. https://openreview.net/pdf?id=r1lgTGL5DE
- Greensmith et al., Variance Reduction Techniques for Gradient Estimates in RL, JMLR 5, 2004. https://jmlr.org/papers/volume5/greensmith04a/greensmith04a.pdf
- Hao et al., On-Policy RL with Optimal Reward Baseline, arXiv:2505.23585, May 2025. https://arxiv.org/abs/2505.23585
- Cheng et al., DSpark: Confidence-Scheduled Speculative Decoding, arXiv:2607.05147, July 2026. https://arxiv.org/abs/2607.05147
- Li et al., SpecForge: Efficient Training for Speculative Decoding, arXiv:2603.18567, March 2026. https://arxiv.org/abs/2603.18567
- Cognition Team, Measuring the Trustworthiness of Open-Source-Derived Models, July 2026. https://cognition.com/blog/measuring-open-source-model-trustworthiness
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch