Cognition SWE-2 릴리스: 성능, 비용, 훈련 혁신

SWE-2는 코딩 에이전트의 파레토 경계를 한층 더 밀어냄

Cognition의 새로운 SWE-2 모델은 FrontierCode 1.1 Main 벤치마크에서 50.0%의 해결률을 달성했으며, 선두인 Fable 5.1과 단 1점 차이에 그치면서도 실행 비용이 64% 낮습니다. 이 결과는 단일 모델이 다양한 노력 수준에서 비용-성능 트레이드오프 곡선을 동시에 우월하게 다룰 수 있음을 보여줍니다.


주요 성능 수치 (높을수록 좋음, 별도 표기 시 제외)

벤치마크 SWE‑2 Kimi K3 Grok 4.6 Fable 5.1 GPT‑5.6 Sol GPT‑6 Astra SWE‑1.7
FrontierCode 1.1 Main 50.0 % 44.2 % 48.0 % 50.9 % 47.5 % 53.3 % 42.0 %
DeepSWE 1.1 73.0 % 68.5 % 67.5 % 67.4 % 72.7 % 74.1 % 37.7 %
Terminal‑Bench 2.1 92.8 % 88.3 % 88.4 % 91.4 % 88.8 % 89.9 % 81.5 %
Terminal‑Bench 4 27.3 % 21.5 % 20.3 % 55.8 % 37.3 % 57.9 % 7.6 %

SWE‑2는 모든 벤치마크에서 이전 모델인 SWE‑1.7를 능가하며, 점수와 비용 면에서 Grok 4.6를 모두 앞섭니다. GPT‑5.6 Sol과 Fable 5.1과 비슷한 성능을 낼 수 있었지만 비용은 그들의 몫의 일부에 불과했으며, GPT‑6 Astra와는 몇 포인트 차이로 근접하면서도 비용은 그의 1/4에 불과했습니다.


SWE-2가 더 높은 지능과 낮은 비용을 동시에 달성하는 방법

1. 단일 RL 실행에서 파레토 정보 기반의 비용 페널티

  • 선형 비용 페널티 – 보상 함수는 R = S – λₑ·C로 정의되며, 여기서 S는 이진 성공 여부, C는 롤아웃 비용, λₑ는 노력 수준 e에 대한 기준 모델의 비용-성능 곡선의 국소 기울기에 맞춰 조정됩니다.
  • 왜 선형인가? – 증명(부록 B)에 따르면, 오직 아핀 페널티만이 보상의 기대값이 롤아웃 분포에 관계없이 평균 비용과 해결률에만 의존하도록 보장합니다.
  • 기울기 일치λₑ를 경계선의 기울기와 동일하게 설정하면 등보상선이 파레토 곡선에 접하게 되어, 보상 증가 시 경계선이 외부로 확장됨을 보장합니다.

“λₑ를 m(국소 기울기)로 설정하면 목적함수가 파레토 곡선을 따라 움직이는 것에 영향을 받지 않으므로, 개선은 직접적으로 경계선을 상향 이동시킵니다.” – Cognition 블로그

2. 길이 가중 보상 기준선

  • 기준선 b̂ = Σ Rᵢ·Lᵢ / Σ Lᵢ (롤아웃 길이에 따라 보상 가중)는 추가 역전파 없이도 최적의 분산 감소 기준선을 근사합니다.
  • 실증적 분석 결과, 추론 정책과 훈련 정책 간의 KL 발산이 크게 감소하여 RL의 안정성이 향상되었습니다.

3. RL 롤아웃 서빙 및 사전 디코딩

  • DSpark 사전 디코딩 – 드래프트 모델이 토큰을 제안하고 정책 모델이 이를 검증함으로써 처리량이 10~20% 증가합니다.
  • SpecForge 훈련 드래프트 – 수락된 토큰 길이를 약 15% 늘리며, 정책의 변화를 실시간으로 추적하기 위해 온라인으로 업데이트됩니다.
  • 저정밀도 MoE 추론 – NVFP4/FP8 커널과 정량화 인식 훈련을 통해 메모리 사용량은 낮추면서도 KL 일치는 유지합니다.

4. 데이터 규모 확대 및 검증기 강화

  • RL 환경 수를 3배로 늘리고 저장소 출처를 확장했습니다.
  • 여러 동시 지시사항을 처리하면서도 모델이 과제에 집중하도록 지시어 따르기 오버레이를 추가했습니다.
  • 재귀적 플라이휠 구현: 중간 체크포인트에서의 롤아웃 결과를 활용해 검증기 실패를 탐지하고 패치함으로써 보상 조작을 줄였습니다.

SWE-2에서 관찰된 행동적 개선점

  • 집중된 탐색 – 첫 번째 수정이 평균 18단계 후에 발생 (SWE-1.7의 48단계 대비), 탐색 오버헤드가 62% 감소했습니다.
  • 테스트 커버리지 – 더 포괄적인 엔드투엔드 테스트를 생성하여 회귀를 조기에 포착합니다.
  • 자원 활용 능력 – 필요한 통합이 없을 경우 기존 컨텍스트(예: Slack 기록)에서 필요한 데이터를 재구성할 수 있습니다.
  • 검증의 철저함 – 도전을 받을 경우 결론을 재추론하고 증거 수집 도구를 실행하며 맹목적인 동의를 피합니다.
  • 노력 수준 차별화중간 노력은 간단/중간 수준 과제에서 낮은 비용으로 뛰어난 성능을 보이며, 최대 노력은 복잡한 문제에 대해 더 많은 계획과 검증을 할당합니다.

신뢰성 평가

Cognition는 SWE-2를 포함한 6개 모델에 대해 내부의 선전/검열 및 컨텍스트 기반 취약성 테스트를 재실행했습니다. 결과는 다음과 같습니다:

  • 선전 및 검열 – SWE-2는 전체적으로 98.0% 통과 (영어 99.8%, 간체중국어 95.2%, 번체중국어 99.1%)
  • 컨텍스트 기반 취약성 – 어떤 모델에도 통계적으로 유의미한 프레임 효과 없음; SWE-2의 평균 취약성 변화는 거의 0에 가까워 동료 모델과 유사함.

Hacker News 커뮤니티 반응

  • 벤치마크 일반화에 대한 회의론 – 상위 댓글은 Terminal-Bench 2.1(92.8%)과 Terminal-Bench 4(27.3%) 사이의 큰 격차를 "벤치마크 최적화"의 증거로 지적했습니다.
  • Kimi K3 후 훈련에 대한 우려 – 일부 사용자는 성능 향상이 강력한 K3 기반 모델에서 유래한 것인지, 아니면 새로운 공학적 혁신인지에 대해 의문을 제기했습니다.
  • 오픈웨이트 대 폐쇄웨이트 논쟁 – 여러 댓글에서 SWE-2가 오픈웨이트로 출시될지, DeepSeek Flash 4.1과 같은 모델들과 비교될지 묻고 있습니다.
  • 제품 경험 – 혼합된 평가: 일부 사용자는 이전의 SWE-1.7를 사용 불가능하다고 평가했지만, 다른 사용자는 SWE-2의 UI인 Devin이 풀리퀘스트 자동화에서 생산성을 향상시킨다고 보고했습니다.
  • 가용성 – 현재 모델은 Cognition의 Devin 데스크톱, CLI, 웹 및 Fusion 플랫폼을 통해 접근 가능하며, 오픈라우터나 제3자 API 통합은 공지되지 않았습니다.

릴리스가 코딩 에이전트 생태계에 미치는 의미

  • 비용-성능 우월성 – SWE-2는 단일의 다중 노력 수준 RL 훈련 모델이 동시에 최상위 해결률과 상당히 낮은 작업당 비용을 달성할 수 있음을 보여줍니다.
  • 방법론적 기여 – 파레토 정보 기반의 선형 비용 페널티는 다양한 사용자 예산을 충족시키는 모델을 훈련하는 원칙적이고 재현 가능한 방법을 제공합니다.
  • 광범위한 채택 가능성 – Cognition가 가중치를 공개하거나 경쟁력 있는 API 가격을 제공한다면, SWE-2는 Fable 5.1이나 GPT-6 Astra와 같은 사내 에이전트의 실질적인 대안이 될 수 있습니다.
  • 남은 질문들 – 커뮤니티는 제시된 벤치마크를 넘어서 실제 세계에서의 일반화 능력과 모델의 오픈성에 대해 여전히 불확실한 상태입니다.

참고문헌

  1. Lu et al., FrontierCode 1.1, July 2026. https://cognition.com/blog/frontier-code-1.1
  2. Pan et al., SWE‑1.7: Frontier Intelligence at a Fraction of the Cost, July 2026. https://cognition.com/blog/swe-1-7
  3. Kimi Team, Kimi K3: Open Frontier Intelligence, arXiv:2607.24653, July 2026. https://arxiv.org/abs/2607.24653
  4. Kool et al., Buy 4 REINFORCE Samples, Get a Baseline for Free!, ICLR 2019 workshop. https://openreview.net/pdf?id=r1lgTGL5DE
  5. Greensmith et al., Variance Reduction Techniques for Gradient Estimates in RL, JMLR 5, 2004. https://jmlr.org/papers/volume5/greensmith04a/greensmith04a.pdf
  6. Hao et al., On-Policy RL with Optimal Reward Baseline, arXiv:2505.23585, May 2025. https://arxiv.org/abs/2505.23585
  7. Cheng et al., DSpark: Confidence-Scheduled Speculative Decoding, arXiv:2607.05147, July 2026. https://arxiv.org/abs/2607.05147
  8. Li et al., SpecForge: Efficient Training for Speculative Decoding, arXiv:2603.18567, March 2026. https://arxiv.org/abs/2603.18567
  9. Cognition Team, Measuring the Trustworthiness of Open-Source-Derived Models, July 2026. https://cognition.com/blog/measuring-open-source-model-trustworthiness

Sources

관련