gavamedia/deltafin
Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents.
Deltafin – 在消费级设备上运行完整的 2.8T 参数 Kimi K3 模型
是什么 – Deltafin 是一个单二进制 Rust 运行时,可加载并生成文本,使用 未剪枝 的 2.8 万亿参数 Kimi K3 混合专家模型(Moonshot AI 公开的精确权重)。该二进制文件自行完成所有路由、分词、缓存和推理;无需 Python 层或外部服务器。可选附加组件(小型 Qwen 模型和 DSpark 检查点)可安装以加速特定工作负载,但核心保证是 每个 token 最终均由 K3 本身生成,绝不会由压缩或近似版本生成。
主要功能
| 特性 | 详情 |
|---|---|
| 完整模型质量 | 保留全部 16 个 MoE 专家;无权重量化或剪枝。 |
| 原生单二进制 | 使用 cargo 构建;运行时、分词器和路由器编译为一个可执行文件。 |
| 跨平台 | macOS arm64(Metal/MPS)和 Linux x86_64/aarch64(CUDA 或 CPU)。 |
| 流式传输与 OpenAI 兼容 API | deltafin serve 实现 /v1/chat/completions、/v1/completions 和 /v1/models,支持 SSE 流式传输。 |
| 按需模型流式下载 | setup --stream 仅下载所需专家,从约 215 GB 开始,而非完整 1.7 TB。 |
| 可选 Qwen 附加组件 | 小型草稿模型(0.6B/1.7B)生成预测;K3 验证后,原始生成速度最高提升约 2.7 倍,输出完全一致。 |
| 性能追踪 | 内置 --stats 标志打印每 token 吞吐量;Apple M1 Max 的基准测试结果已记录(约 0.29 token/s)。 |
| 健康检查工具 | 安装或升级后验证运行时、模型文件和缓存。 |
| MIT 许可核心 | 编译的代码为 MIT;模型权重保留原始许可证。 |
快速开始(来自 README)
# 1. 克隆并构建
git clone https://github.com/gavamedia/deltafin.git && cd deltafin
cargo build --locked --release
# 2. 下载模型(完整或流式)
# 完整 1.7 TB 下载(最快运行时)
./target/release/deltafin setup --full
# 或仅流式下载所需部分(从约 215 GB 开始)
./target/release/deltafin setup --stream
# 3. 可选 Qwen 附加组件,用于更快的原始生成
./target/release/deltafin setup-qwen
运行推理
聊天(使用 K3 的聊天模板,并在模型的回合结束 token 处停止):
./target/release/deltafin run --chat --prompt "土星的三个最大的卫星是什么?"
原始续写(指定 token 限制):
./target/release/deltafin run --prompt "法国的首都是" --max-new 17
添加 --stats 可查看每 token 的耗时。
提供 OpenAI 兼容端点
./target/release/deltafin serve --host 127.0.0.1 --port 8000
然后客户端可调用:
curl http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"你好!"}]}'
服务器强制执行 OpenAI API 的严格子集(仅文本、贪婪生成、一次一个请求),对不支持的字段返回清晰错误信息。
更新
./target/release/deltafin upgrade # 重新构建二进制文件,保留模型文件
脚本在拉取新提交前会检查工作树是否干净。
仓库中包含的文档
- NATIVE-RUNTIME.md – 单二进制运行时设计、路由、专家预取、分词。
- SERVER.md – 支持的 OpenAI API 字段、流式行为、限制。
- PERFORMANCE.md – 基准测试数字(如 M1 Max 上的 0.29 token/s)的测量方法。
- PLATFORMS.md – 支持的 OS/CPU/GPU 组合及所需库。
- HEALTH-CHECKS.md, STORAGE.md, CONFIGURATION.md 等。
谁构建了它?
Deltafin 是一个独立的开源项目,基于 Moonshot AI 官方发布的 Kimi K3 权重构建原生 Rust 运行时。也整合了社区贡献,如 DSpark 检查点(Inferact)、GigaToken 分词器,以及外部开发者贡献的 SIMD/CUDA 优化。
许可证
Deltafin 代码库采用 MIT 许可证 发布。模型权重、DSpark 和可选 Qwen 检查点保留其原始许可证(详见 docs/THIRD_PARTY_NOTICES.md)。
总结 – Deltafin 是一个面向研究者的工具,适用于任何希望在高端笔记本或工作站上实验 完整 Kimi K3 MoE 模型的用户,无需为速度牺牲任何模型参数。它提供编译二进制文件、简单 CLI 和 OpenAI 兼容服务器,全部文档化且开源许可。
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目