MoonshotAI/Kimi-K2.5
Open Visual Agentic Intelligence
해결하는 문제
Kimi K2.5는 시각과 언어 이해 간의 격차를 메우고 고도화된 에이전트 기능을 제공하도록 설계되었습니다. 다양한 모달리티(텍스트, 이미지, 비디오) 간의 추론은 물론, 전문적인 에이전트들을 조율하여 복잡한 작업을 자율적으로 수행할 수 있는 모델을 구축하는 문제를 해결합니다.
작동 방식
K2.5는 1조 개의 총 파라미터(1토큰당 320억 개 활성화)를 가진 Mixture-of-Experts(MoE) 아키텍처를 기반으로 한 네이티브 멀티모달 모델입니다. 15조 개의 혼합 시각 및 텍스트 토큰을 지속적으로 사전 훈련하여 개발되었습니다. 모델은 MoonViT 비전 인코더와 MLA(Multi-head Latent Attention)를 사용하여 최대 256K 토큰의 컨텍스트 길이를 처리할 수 있습니다. "즉시" 모드와 "사고" 모드를 모두 지원하여 빠른 응답과 깊은 추론 사이를 전환할 수 있습니다.
대상 사용자
이 모델은 고급 AI 에이전트, 멀티모달 애플리케이션, 시각적 기반(예: UI 디자인을 코드로 변환하는 것 등)이 필요한 자동 코드 도구를 개발하는 개발자 및 연구자를 대상으로 합니다.
주요 특징
- 네이티브 멀티모달리티: 크로스모달 추론을 위한 통합된 시각 및 언어 이해.
- 에이전트 스웜: 복잡한 작업을 도메인 특화 에이전트가 병렬로 처리하는 하위 작업으로 분해하는 자율적 실행 방식.
- 시각 기반 코드 생성: UI 디자인이나 비디오 워크플로우와 같은 시각적 사양에서 직접 코드를 생성할 수 있는 능력.
- 거대 규모: 15조 토큰의 방대한 데이터셋으로 훈련된 1조 파라미터 MoE 아키텍처.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch