gavamedia/deltafin

Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents.

Deltafin – 소비자용 기기에서 전체 2.8T 파라미터 Kimi K3 모델 실행

무엇인가요 – Deltafin은 자르지 않은 2.8조 파라미터 Kimi K3 Mixture-of-Experts 모델(문샷 AI가 공개한 정확한 가중치)을 로컬에서 로드하고 텍스트를 생성할 수 있는 단일 바이너리 Rust 런타임입니다. 이 바이너리는 라우팅, 토큰화, 캐시, 추론을 모두 자체적으로 처리하며, 파이썬 계층이나 외부 서버가 필요하지 않습니다. 특정 워크로드를 가속화하기 위한 선택적 추가 기능(작은 Qwen 모델과 DSpark 체크포인트)을 설치할 수 있지만, 핵심 보장은 모든 토큰은 K3 자체가 생성된다는 점이며, 압축되거나 근사된 버전에 의해 생성되지 않습니다.


주요 기능

기능 세부 사항
완전한 모델 품질 16개의 MoE 전문가 모두 유지; 가중치 양자화나 자르기 없음.
네이티브 단일 바이너리 cargo로 빌드; 런타임, 토크나이저, 라우터가 하나의 실행 파일로 컴파일됨.
크로스 플랫폼 macOS arm64(Metal/MPS) 및 Linux x86_64/aarch64(CUDA 또는 CPU).
스트리밍 및 OpenAI 호환 API deltafin serve/v1/chat/completions, /v1/completions, /v1/models를 SSE 스트리밍으로 구현.
요청 시 모델 스트리밍 setup --stream로 필요한 전문가만 다운로드; 전체 1.7TB가 아닌 약 215GB부터 시작.
선택적 Qwen 추가 기능 작은 드래프트 모델(0.6B/1.7B)이 예측 생성; K3가 검증하여 출력은 동일하면서 최대 약 2.7배 빠른 원시 완성 가능.
성능 추적 내장된 --stats 플래그로 토큰당 처리량 출력; Apple M1 Max에서의 벤치마크 결과(약 0.29 토큰/초) 문서화됨.
헬스 체크 유틸리티 설치 또는 업그레이드 후 런타임, 모델 파일, 캐시 검증.
MIT 라이선스 코어 컴파일하는 코드는 MIT; 모델 가중치는 원래 라이선스 유지.

빠른 시작 (README에서)

# 1. 클론 및 빌드
git clone https://github.com/gavamedia/deltafin.git && cd deltafin
cargo build --locked --release

# 2. 모델 다운로드 (풀 또는 스트리밍)
# 전체 1.7TB 다운로드 (가장 빠른 실행)
./target/release/deltafin setup --full
# 또는 필요한 부분만 스트리밍 (약 215GB부터 시작)
./target/release/deltafin setup --stream

# 3. 더 빠른 원시 완성용 선택적 Qwen 추가
./target/release/deltafin setup-qwen

추론 실행

채팅 (K3의 채팅 템플릿 사용, 모델의 턴 종료 토큰에서 중단):

./target/release/deltafin run --chat --prompt "토성의 세 개의 가장 큰 위성은 무엇입니까?"

원시 연속 (토큰 수 제한 지정):

./target/release/deltafin run --prompt "프랑스의 수도는" --max-new 17

--stats를 추가하면 토큰당 시간을 확인할 수 있습니다.


OpenAI 호환 엔드포인트 제공

./target/release/deltafin serve --host 127.0.0.1 --port 8000

그런 다음 클라이언트는 다음과 같이 호출할 수 있습니다:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"안녕하세요!"}]}'

서버는 OpenAI API의 엄격한 하위 집합(텍스트 전용, 그리디 생성, 한 번에 하나의 요청)을 강제하며, 지원되지 않는 필드에 대해 명확한 오류 메시지를 반환합니다.


업데이트

./target/release/deltafin upgrade   # 바이너리 재빌드, 모델 파일 유지

스크립트는 새로운 커밋을 가져오기 전에 작업 트리가 깨끗한지 확인합니다.


리포지토리 내 포함된 문서

  • NATIVE-RUNTIME.md – 단일 바이너리 런타임, 라우팅, 전문가 사전 가져오기, 토큰화 설계.
  • SERVER.md – 지원되는 OpenAI API 필드, 스트리밍 동작, 제한사항.
  • PERFORMANCE.md – 벤치마크 수치(예: M1 Max에서의 0.29 토큰/초) 측정 방법.
  • PLATFORMS.md – 지원되는 OS/CPU/GPU 조합 및 필요 라이브러리.
  • HEALTH-CHECKS.md, STORAGE.md, CONFIGURATION.md 등.

누가 만들었나요?

Deltafin은 Moonshot AI가 공식적으로 공개한 Kimi K3 가중치 위에 네이티브 Rust 런타임을 구축한 독립적인 오픈소스 프로젝트입니다. 또한 커뮤니티 기여물(예: Inferact의 DSpark 체크포인트, GigaToken 토크나이저, 외부 개발자들의 SIMD/CUDA 최적화)도 포함되어 있습니다.


라이선스

Deltafin 코드베이스는 MIT 라이선스로 배포됩니다. 모델 가중치, DSpark, 선택적 Qwen 체크포인트는 각각 원래 라이선스를 유지합니다(docs/THIRD_PARTY_NOTICES.md에 목록됨).


결론 – Deltafin은 고성능 노트북이나 워크스테이션에서 전체 Kimi K3 MoE 모델을 실험하고 싶은 연구자나 개발자를 위한 도구입니다. 속도를 위해 모델의 파라미터를 희생하지 않고, 컴파일된 바이너리, 간단한 CLI, OpenAI 호환 서버를 제공하며, 모든 것이 문서화되고 오픈 라이선스되어 있습니다.

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트