Moonshot AI, 높은 수요로 인해 Kimi K3 구독 일시 중단

Moonshot AI, 서비스 품질 보호를 위해 새로운 구독 일시 중단

Moonshot AI는 수요가 회사의 현재 컴퓨팅 용량을 한계까지 끌어올렸기 때문에 Kimi K3 모델에 대한 새로운 구독을 일시적으로 중단했습니다. 회사는 현재 멤버를 위한 컴퓨팅 자원을 우선시함으로써 기존 구독자의 경험을 보호하기 위해 이 조치를 취했다고 밝혔습니다.

이미 Kimi 서비스를 구독한 사용자들은 이 일시 중단으로 영향을 받지 않습니다. 이 결정은 기술 커뮤니티의 일부에서 고객 중심 접근 방식으로 여겨지며, 사용자에게 알리지 않고 부하를 관리하기 위해 사용 제한을 조용히 줄이는(nerfing) 산업 관행과 대조됩니다.

기술 아키텍처 및 성능

하이브리드 어텐션 메커니즘

Kimi K3는 상당한 수의 RNN 및 선형 어텐션 레이어를 포함하는 하이브리드 아키텍처를 사용합니다. 기술적 관찰에 따르면, 이 모델은 전체 어텐션 레이어보다 RNN/선형 어텐션 레이어가 약 세 배 더 많습니다. 이 설계는 장기 컨텍스트 작업에 대해 모델을 매우 효율적으로 만들 것이라고 이론화되며, xLSTMs의 아키텍처와 유사점을 보입니다.

코딩 및 에이전틱 기능

Kimi K3는 한샷 추론보다는 모델이 도구를 사용하고 반복 호출을 통해 코드를 개선하는 에이전틱 코딩 작업에서 강력한 성능을 보여줍니다. 멀티 에이전트 게임 코딩 평가에서 Kimi K3는 에이전틱 코딩에서 3위를 차지했으며, Sol과 Fable만을 뒤따르고 한샷 코딩에서는 19위를 기록했습니다.

사용자들은 다음과 같은 특정 강점을 보고했습니다:

  • 코드 리뷰: PR 및 코드 리뷰 수행 시 높은 품질.
  • 분석적 톤: 다른 프론티어 모델에 비해 절제되고 신중한 톤.
  • 복잡한 연구: (예: 5시간 동안 12가지不同角色를 통해 54,000단어 보고서를 생성)와 같이 광범위한 보고서를 위한 멀티 에이전트 워크플로우를 처리할 수 있는 능력.
  • 검열: 일부 사용자는 Kimi K3가 Anthropic의 모델에 비해 눈에 띄게 덜 검열되었다고 지적합니다.

사용자 경험 및 운영 과제

지연 및 속도

Moonshot AI의 현재 인프라 과부하로 인해 사용자들은 상당한 지연을 보고했습니다. 코드 리뷰와 같이 비교적 간단한 작업은 '영원히' 걸린다고 묘사되며, 일부 복잡한 프롬프트는 일일 할당량에 도달하기 전까지 최대 12분이 소요됩니다.

가격 및 할당량

사용자 피드백에 따르면 다양한 구독 등급 간 가치에 큰 차이가 있습니다:

  • $20 플랜: 매우 제한적인 속도 제한이 있다고 보고되었으며, 일부 사용자는 며칠 만에 주간 예산을 소진합니다.
  • 상위 등급: $100 및 $200 플랜 사용자들은 더 나은 경험을 보고하며, 모델은 Claude Opus와 능력 면에서 비슷하지만 종종 '불완전한 표현'에 덜 prone하다고 언급합니다.
  • 서드파티 추론: Kimi K3는 SiliconFlow와 같은 집계자를 통해 이용할 수 있지만, 비용은 DeepSeek과 같은 경쟁자보다 상당히 높을 수 있습니다(예: 비캐시 입력 토큰에 대해 3배, 출력 토큰에 대해 5배의 비용).

모델 가용성에 대한 커뮤니티 관점

Kimi K3의 인기 급증으로 폐쇄형 모델 랩과 오픈 웨이트 모델의 지속 가능성에 대한 보다 광범위한 논의가 촉발되었습니다. 코멘터들은 오픈 웨이트 모델이 사용자가 자신의 하드웨어 또는 다양한 추론 제공자를 활용할 수 있게 하여, 주요 랩이 인프라 장애에 직면하더라도 토큰 가용성을 보장한다고 강조했습니다. 커뮤니티에서는 Moonshot AI가 모델을 오픈소스화하여 용량 제약을 완화하고 접근성을 넓히도록 요구하고 있습니다.

Sources

관련