Kimi Delta Attention: 유도, 구현, 그리고 커뮤니티 반응
Kimi Delta Attention: 유도, 구현, 그리고 커뮤니티 반응
Kimi Delta Attention는 채널별 망각을 갖는 DeltaNet 위에 구축됩니다
Kimi Delta Attention (KDA)는 DeltaNet의 델타‑규칙 쓰기를 유지하면서 스칼라 보존 게이트 αₜ를 벡터 αₜ ∈ [0,1]^{dₖ} 로 교체하고 이를 대각 행렬 Dₜ = Diag(αₜ) 로 적용합니다. 이를 통해 각 키 채널을 독립적으로 망각하거나 보존할 수 있으며, Gated DeltaNet은 전체 상태에 단일 αₜ를 적용합니다. 나머지 재귀 단계—예측, 보정, 쓰기, 읽기—는 변하지 않습니다.
유도는 소프트맥스 어텐션에서 KDA로 세 단계에 걸쳐 진행됩니다
인과적 소프트맥스 어텐션에서 시작하여 소프트맥스를 제거하면 상태 Sₜ = Σ_{i≤t} |v_i⟩⟨k_i| 인 선형 어텐션이 됩니다. 업데이트가 +=와 유사하게 동작한다는 것을 인식하고, DeltaNet은 오류 기반 쓰기 eₜ = βₜ(|v_t⟩ − S_{t−1}|k_t⟩) 를 도입하여 Sₜ = S_{t−1} + eₜ⟨k_t| 로 만듭니다. Gated DeltaNet은 델타 업데이트 전에 전역 망각 계수 αₜ를 추가합니다: Sₜ = αₜ S_{t−1} + βₜ(|v_t⟩ − αₜ S_{t−1}|k_t⟩)⟨k_t|. KDA는 αₜ를 대각 행렬로 만들어 채널별 망각을 제공함으로써 이를 일반화합니다: Sₜ = S_{t−1} Dₜ + βₜ(|v_t⟩ − S_{t−1} Dₜ|k_t⟩)⟨k_t|.
효율적인 실행은 결합된 순환 커널 또는 청크 단위 커널 중 하나를 사용합니다
자동 회귀 디코딩의 경우, 결합된 순환 Triton 커널이 한 번에 하나의 토큰을 처리합니다:
state *= exp(g_t)[:,None]; prediction = sum(state * k_t[:,None], axis=0); residual = β_t * (v_t − prediction); state += k_t[:,None] * residual[None,:]; output = sum(state * (q_t * SCALE)[:,None], axis=0).
훈련 및 긴 프리필의 경우, 청크 단위 구현은 동일한 재귀를 행렬 곱으로 재구성하여 임시 오류를 계산하고, 삼각형 해결을 통해 인과적 종속성을 복원하며, 상태를 빠르게 전진시키고, 인과적 출력을 생성합니다—I+R_c가 단위 대각을 가진 삼각 행렬이므로 조밀한 역행렬을 형성하지 않아도 됩니다.
커뮤니티 반응은 유도의 명확성과 사후 겸손함을 강조합니다
많은 댓글자들이 브라‑ket 표기와 기존 수학 표기 사이의 전환을 칭찬하며, 이것이 형태와 연산을 더 명확하게 만든다고 말했습니다. 한 사용자는 “수학과 물리 전환이 마음에 듭니다.”라고 썼고, 또 다른 사용자는 “전환이 정말 유용합니다. 좋았어요!!”라고 적었습니다. 브라‑ket 선택은 결국 이해를 돕는 면책 조항으로 설명되었습니다: “저자는 알고리즘과 데이터 구조를 더 명확하게 만들기 위해 브라‑ket 표기를 선택했다고 서두에 면책 조항을 적은 것을 보면 정말 대단하다는 생각이 듭니다.” 여러 독자는 자신이 직접 이 방법을 고안할 수 없었을 것이라고 말했으며, “대충 읽어본 뒤, 나는 확신합니다. 사실 나는 Kimi Delta Attention을 생각해낼 수 없었을 겁니다.”와 “내가 Kimi Delta Attention을 생각해낼 방법이 없었어요.”와 같은 댓글을 남겼습니다. 몇몇은 해결책이 뒤돌아보면 명백해 보인다고 지적하며, “누구든지 그걸 할 수 있었어요! 우리는 달걀을 깨뜨릴 수 있다고 말하지 않았잖아요!”라는 콜럼버스 달걀 이야기를 인용했습니다. 몇몇은 글이 LLM이 생성했는지 의심하며, 정체성 설명을 단서로 꼽았습니다. 다른 이들은 단계별 유도가 복잡한 주제를 “훨씬 더 이해하기 쉽게” 만들었다고 평가했습니다. dₖ와 같은 기호에 대한 복습을 요청하는 의견도 있었는데, 이는 표기가 도움이 되었지만 여전히 차원에 대한 배경 지식이 필요하다는 것을 보여줍니다.
Kimi Delta Attention은 개념적으로 단순하면서도 효과적인 선형 어텐션 확장을 제공합니다
스칼라 보존을 채널별 대각 행렬로 확장함으로써, KDA는 모든 채널이 동일한 망각 비율을 공유하는 Gated DeltaNet의 한계를 해결합니다. 결과적인 상태 업데이트는 대각 행렬 플러스 저랭크 연산으로 남아 있어, 저지연 순환 디코딩과 고처리량 청크 단위 훈련 모두를 가능하게 합니다. 소프트맥스 어텐션에서 DeltaNet, Gated DeltaNet을 거쳐 KDA에 이르는 기사 유도는 많은 독자들이 접근하기 쉬운 명확한 경로를 제공했으며, 독자들은 독립적으로 해결책에 도달하지 못했음을 인정했습니다.
SUMMARY: Kimi Delta Attention (KDA)는 스칼라 보존을 채널별 대각 행렬로 교체하여 키 채널을 독립적으로 망각할 수 있게 하면서 델타 규칙 쓰기를 유지하고, 결합된 순환 또는 청크 단위 Triton 커널로 효율적으로 실행될 수 있습니다.
TITLE: Kimi Delta Attention: 유도, 구현, 그리고 커뮤니티 반응