Kev: Qwen3.5 기반 오픈소스 결정 모델
Kev는 고속의 구조화된 분류 및 평가를 위한 작은 결정 모델 패밀리입니다. Qwen3.5 베이스 모델 위에 구축된 Kev는 Jev의 아키텍처를 영감으로 받아, 단일 입력 텍스트에 대해 한 번의 순전파로 여러 결정 질문(예/아니오, 다중 선택, 평가)을 동시에 처리할 수 있도록 설계되었습니다.
아키텍처 및 구현
Kev는 Qwen 베이스 모델 위에 랭크-16 LoRA 어댑터와 사용자 정의 포인터 헤드를 사용합니다. 시스템은 입력 상태를 한 번만 처리하고, 이를 여러 독립적인 질문에 재사용함으로써 효율성을 극대화하도록 설계되었습니다.
질문 고립 및 처리
주의만 사용하는 베이스 모델(예: Qwen3)의 경우, Kev는 특정 주의 마스크를 사용하여 토큰이 입력 상태와 자신의 질문만 읽을 수 있도록 하되, 다른 질문을 읽는 것을 방지합니다. 이는 질문들이 서로 영향을 주지 않도록 보장합니다.
Qwen3.5 모델은 주의 마스크를 무시하는 게이트드 델타넷 레이어(반복 레이어)를 포함하고 있으므로, Kev는 각 질문을 독립적인 행으로 처리합니다. 서버는 상태를 한 번 계산하고 모든 행에 캐시를 재사용함으로써 질문 간 정확한 고립을 유지합니다.
포인터 헤드
텍스트 토큰을 생성하는 대신, Kev는 각 옵션의 종료 태그(</opt>)의 숨겨진 상태를 질문의 결정 토큰(<decide>)의 숨겨진 상태와 비교하여 점수를 매깁니다. 이후 소프트맥스 함수는 이러한 점수를 확률로 변환하여 각 답변에 대한 보정된 신뢰도 수준을 제공합니다.
모델 패밀리 및 성능
Kev는 0.8B, 4B, 9B 세 가지 크기로 제공됩니다. 세 모델 모두 동일한 데이터와 설정으로 훈련되었으며, 사용자는 메모리와 정확도 요구 사항에 따라 모델을 선택할 수 있습니다.
벤치마크 및 정확도
Kev-9B가 가장 강력한 모델로, 테스트 세트에서 0.852의 정확도를 달성했습니다. 새로운 소스 개발 세트에서 호스팅된 Jev 모델보다 3.5점 낮은 성능(0.822 대 0.857)을 보였지만, 미지의 정책 규칙 유형에 대해 강력한 일반화 능력을 보여줍니다.
| 모델 | 베이스 | 정확도 (새로운 소스 - 테스트) | 브라이어 점수 (새로운 소스 - 테스트) |
|---|---|---|---|
| Kev-0.8B | Qwen3.5-0.8B | 0.684 | 0.460 |
| Kev-4B | Qwen3.5-4B | 0.837 | 0.255 |
| Kev-9B | Qwen3.5-9B | 0.852 | 0.237 |
서빙 성능
지연 시간은 하드웨어에 따라 크게 달라집니다. CUDA(H100)에서는 다섯 질문 요청에 대해 수십 밀리초가 소요됩니다. Apple Silicon에서는 델타넷 레이어에 대한 빠른 커널이 부족하여 9B 모델은 요청당 약 2초가 걸리지만, 4B 모델은 약 779ms 정도 소요됩니다. 맥에서 낮은 지연 시간이 요구된다면 이전 세대의 Qwen3 기반 모델을 권장합니다.
API 및 통합
Kev의 API는 TypeSafe의 System One과 일치하여 TypeSafe Python SDK와 원활하게 통합할 수 있습니다. /v1/systemone 엔드포인트는 state(평가할 텍스트)와 questions 세트를 수락합니다.
지원되는 질문 유형
- noul: 이진 예/아니오 질문으로 "예"일 확률을 반환합니다.
- choice: 다중 선택 질문으로 가장 가능성 높은 옵션, 모든 옵션의 확률, 그리고 신뢰도 점수를 반환합니다.
- score: 평가 질문으로 평균 수준 인덱스, 레전드, 확률을 반환합니다.
훈련 및 미세 조정
Kev는 올바른 답변에 대해 교차 엔트로피를 사용하여 훈련되며, 베이스 가중치는 고정된 상태에서 어댑터와 포인터 헤드가 함께 훈련됩니다.
사용자 정의 미세 조정
사용자는 JSONL 형식의 자체 도메인 전용 데이터를 사용하여 Kev를 미세 조정할 수 있습니다. 저자는 --init_from 플래그를 사용하여 공개된 체크포인트의 어댑터와 포인터 헤드를 로드하는 것을 권장합니다. 이는 모델의 일반적인 결정 능력을 유지하면서 도메인 전용 지식을 추가합니다. 한 테스트에서 베이스 모델에서 미세 조정한 경우 Kev의 평가 세트에서 0.33 점을 기록했지만, 공개된 체크포인트에서 미세 조정한 경우 0.83 정확도를 유지하며 새로운 도메인에서 0.88까지 도달했습니다.
제한 사항 및 고려 사항
- 보정: 새로운 소스에 대해 원시 확률은 과도하게 자신감을 보일 수 있습니다.
KEV_TEMPERATURE=2.0을 사용하면 Kev-9B의 확신 오류(확률이 $\ge 0.9$인 잘못된 답변)를 8.7%에서 4.4%로 줄일 수 있습니다. - 날짜 계산: 모델은 원시 날짜 뺄셈을 처리하는 데 어려움을 겪습니다.
KEV_DATE_FACTS=1을 설정하면 절대 날짜 간의 일수 차이를 추가하여 Kev-9B의 마감일 정책 질문 정확도를 0.80에서 0.90으로 향상시킵니다. - 옵션 순서: 단일 질문 내에서 옵션 순서를 변경해도 여전히 답변에 영향을 줄 수 있습니다. 질문 고립에도 불구하고 말입니다.
- 지식 격차: Jev에 비해 일반 지식(MMLU)에서 큰 격차가 있습니다. 이는 베이스 모델의 한계로 인한 것으로 보입니다.
커뮤니티 인사이트
개발자들 간의 논의에 따르면, Jev 유사 모델은 내부 라우팅 로직, 데이터 레이블링, 에이전트 워크플로우에서 도구 호출 오버헤드를 줄이는 데 특히 유용합니다. 한 사용자는 Jev로 프롬프트를 라우팅하여 도구를 좁히고 이후 프론티어 모델로 전달함으로써 도구 호출 횟수를 60% 줄였다고 밝혔습니다.
그러나 일부 비평가들은 Jev의 핵심 가치가 아키텍처보다는 훈련 데이터에 있다고 주장하며, 유사한 고품질 데이터셋이 없으면 오픈소스 파생 모델이 원본 호스팅 모델의 성능을 따라잡기 어려울 것이라고 지적합니다.
Sources
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch