빠른 에이전트 기반 의사결정을 위한 대조적 언어 모델(CLMs)
대조적 언어 모델(CLMs)은 행동 선택을 생성적 문제보다는 검색 문제로 간주함으로써 고속 에이전트 기반 의사결정을 가능하게 합니다. 상태와 행동 임베딩을 공유된 공간에서 대조 학습 목표를 통해 정렬함으로써, CLM-8B는 컴퓨터 사용, 게임, 도구 호출 작업에서 Jev와 비슷한 성능을 달성하면서 지연 시간을 최대 9배까지 줄였습니다.
아키텍처: 분리된 상태 및 행동 인코더
CLM은 표준 순차적 생성(autoregressive, AR) 프로세스를 이중 인코더 아키텍처로 대체합니다. 시스템은 상태 인코더와 행동 인코더로 구성되며, 냉각된 LLM 백본과 학습 가능한 MLP 프로젝션 헤드(약 20M 파라미터)를 사용합니다.
- 메커니즘: 두 인코더는 각각의 입력을 공유된 임베딩 공간으로 매핑합니다. 상태-행동 쌍의 점수는 그 임베딩 간의 코사인 유사도로 계산됩니다.
- 추론 효율성: 상태와 행동이 분리되어 있기 때문에, 각각의 임베딩을 별도로 캐시할 수 있습니다. 행동 집합이 고정된 환경(예: 슈퍼 마리오)에서는 모델이 각 단계에서 상태 임베딩만 재계산하면 되며, 캐시된 행동 임베딩을 재사용할 수 있습니다. 이로 인해 다수의 전방 전파에서 단일 전파로 계산 비용이 감소합니다.
- 스케일링: 약 1,000개의 후보 행동이 있을 때, CLM은 Jev보다 13배 빠르다고 보고되었습니다.
훈련 파이프라인 및 스케일링 법칙
CLM은 상태-행동 정렬을 점진적으로 개선하기 위해 세 단계의 훈련 단계를 거칩니다:
- 사전 훈련: 질문을 상태로, 답변을 행동으로 간주하여 약 60M개의 Nemotron Q&A 쌍을 사용해 양방향 InfoNCE 손실로 모델을 훈련합니다. 이는 광범위한 의미 표현을 구축합니다.
- 중간 훈련: Gemini 2.5 Flash-Lite로 생성된 약 30M개의 합성 하드 음성(negatives)에 노출됩니다. 이들은 의미적으로 유사하지만 잘못된 답변으로, 세부적인 구분 능력을 향상시키기 위해 설계되었습니다.
- 후속 훈련: Agent Data Protocol(ADP) 데이터셋에서 약 1M개의 에이전트 트래잭션과 Endless-Terminals 및 LiteCoder-Terminal-SFT의 종단 추적을 사용해 에이전트 환경에 맞는 표현 공간을 적응시킵니다.
후속 훈련 중 치명적인 잊음(catastrophic forgetting)을 방지하기 위해, 팀은 데이터 재생을 활용한 공동 훈련(co-training)을 사용하며, Nemotron DQA 예제 40%와 에이전트 트래잭션 60%를 혼합합니다.
스케일링 법칙: 테스트 대조 손실은 훈련 컴퓨팅, 데이터셋 크기, 프로젝션 헤드 크기, 인코더 크기와 거듭제곱 법칙(power law) 관계를 따릅니다. 인코더 크기 확장이 가장 강력한 성능 향상을 제공합니다. 최적의 프로젝션 헤드 크기($N^*$)는 훈련 토큰 수($D^{1.02}$)와 선형적으로 증가하며, 평균적으로 파라미터당 약 310개의 토큰을 포함합니다.
성능 및 벤치마크
CLM-8B는 특히 다른 모델(예: Opus 5 또는 Fable 5)이 샘플링한 여러 후보 중에서 최고의 해결책을 선택하는 보상 모델(reward model)로 사용할 때 강력한 검증 능력을 보입니다.
- 에이전트 기반 코딩: CLM은 DeepSWE(81.6%)와 Terminal Bench 2.1(87.6%)에서 최고 성능(SOTA)을 달성했습니다.
- 지연 시간: H100 GPU에서 CLM은 검증 작업에서 Jev보다 4-6배 빠른 추론을 제공합니다.
- 일반화 능력: 사전 훈련은 모델의 표현을 유용한 의사결정 공간으로 재구성하여, 기준 LLM 임베딩(예: Qwen3-8B)보다 골드 답변을 더 높게 순위 매길 수 있도록 했습니다.
커뮤니티의 통찰과 기술적 비판
기술 사용자들 사이의 논의는 CLM 접근법에 대한 몇 가지 중요한 관점을 제시합니다:
- 검증 vs. 생성: 일부 사용자는 DeepSWE에서 높은 점수를 달성하는 것이 초기 생성이 아니라 여러 후보 중에서 최고의 것을 선택하는 검증 역할을 하기 때문이라고 지적합니다.
- 인도적 편향: 비판자들은 코사인 유사도를 독립적으로 인코딩된 벡터에 적용하는 것이 대규모 K의 의미적 행동 매칭(예: WikiRacing)에는 효과적이지만, 날짜 산술이나 부정 체인과 같은 "타입 기반 결정" 작업에서는 어려움을 겪을 수 있다고 주장합니다.
- 용어 사용: 일부 사용자는 모델을 "시스템 일(System One)"이라고 부르는 것에 반대하며, 칸헤먼 프레임워크는 인간의 인지 과정을 설명하는 것이지 AI 모델의 속도 기반 분류에 해당하지 않는다고 주장합니다.
- 하드웨어 효율성: 단일 RTX 4090에서 약 1시간 내에 프로젝션 헤드를 훈련할 수 있다는 점은 소비자 등급 하드웨어를 사용하는 개발자들에게 특히 매력적입니다.
"이 접근법은 정말 멋지다고 생각합니다. 그리고 현대 LLM을 사용해 입력을 처리한 후, 일반적인 AR 디코딩과 비슷한 성능을 내는 매우 빠른 비-AR 방식으로 모델의 다음 에이전트 단계를 추출할 수 있다는 점을 시사합니다."
미래 로드맵
이 프로젝트는 현재 훈련 중인 멀티모달 CLM-35B로 확장되고 있습니다. 향후 목표로는 로봇 및 컴퓨터 사용 작업을 위한 이미지와 동영상을 지원하는 아키텍처 확장과 함께, 하드 음성 마이닝 및 에이전트 후속 훈련을 위한 데이터 레시피의 추가 확장이 포함됩니다.
Sources
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch