Kimi K3 아키텍처 개요
Kimi K3 아키텍처 개요
Kimi K3는 2.8조 파라미터를 갖는巨大한 오픈-웨이트 모델로, 이전 Kimi Linear 모델의 아키텍처를 확장했습니다. LatentMoE와 멀티-헤드 레이턴트 어텐션의 통합을 통해 추론 효율을 극대화하는 데 중점을 두며, 네이티브 멀티모달 지원을 도입했습니다.
효율성 중심 아키텍처 구성 요소
Kimi K3는 표준 모델 구성 요소를 효율성을 tweaked한 버전으로 대체하여 2.8T 파라미터 규모의 계산 오버헤드를 줄입니다.
LatentMoE
Kimi K3는 Nemotron 3 Ultra에서 발견되는 구성 요소와 유사한 LatentMoE를 구현합니다. 이 접근 방식은 다운-프로젝션을 통해 큰 선형 레이어를 압축하여 Mixture-of-Experts(MoE) 레이어의 메모리와 계산 요구 사항을 효과적으로 줄입니다.
멀티-헤드 레이턴트 어텐션과 Kimi Delta 어텐션
tracking 추론을 더욱 최적화하기 위해 모델은 일반 어텐션 메커니즘을 멀티-헤드 레이턴트 어텐션과 Kimi Delta 어텐션으로 대체합니다. 이러한 구성 요소는 규모에서 어텐션 메커니즘의 처리량과 효율성을 향상하도록 설계되었습니다.
성능 및 구조적 향상
효율성을 넘어, Kimi K3는 모델의 학습 용량과 검증 손실을 개선하기 위한 특정 구조적 변경 사항을 도입합니다.
어텐션 잔차
Kimi K3는 잔차 경로를 개선하기 위해 어텐션 잔차를 사용합니다. DeepSeek V4에서 사용되는 manifold-constrained Hyper-Connections(mHC)과 달리—잔차 경로를 넓이는—어텐션 잔차는 어텐션 점수를 사용하여 기여도의 가중치를 결정함으로써 레이어 간 잔차를 연결합니다. 이 수정은 검증 손실과 다운스트림 성능을 일관되게 개선하며, 훈련 비용에 약 4%, 추론 비용에 약 2%를 추가합니다.
NoPE (No Positional Embeddings)
지역 어텐션 레이어에서 회전 위치 임베딩(RoPE)을 사용하는 산업 트렌드와 달리, Kimi K3는 überall NoPE(No Positional Embeddings)를 사용합니다. 이 설계는 Kimi Linear에서 상속받았으며, Kimi K3를 위치 정보를 명시적으로 학습하는 대신 암시적으로 학습하도록 위치 임베딩을 완전히 생략한 최초의 프론티어-레벨 모델로 만듭니다.
커뮤니티 통찰 및 관찰
K3 출시와 관련된 기술 논의는 위치 임베딩 생략에 대한 혁신 수준과 회의론을 모두 강조합니다.
"흥미롭게도, Kimi K3는 모든 RoPE 레이어를 제거하고 대신 überall NoPE(No Positional Embeddings)를 사용합니다...これが実際に 작동한다는 것이 정말 이해되지 않습니다. 이건 단지 토큰 수프가 되는 건가요?"
몇몇 관찰자들은 Kimi Delta와 같은 선형-어텐션 메커니즘이 위치 요구 사항을 암시적으로 처리하여 명시적인 RoPE 레이어 없이 모델이 작동할 수 있도록 한다고 제안합니다. 또한, 사용자들은 Kimi K3의 성능이 Opus 4.7/4.8과 같은 다른 프론티어 모델과 altamente 경쟁적이라고 지적했습니다.