Thinking Machines Inkling 发布说明 / 新功能
Thinking Machines Inkling 发布说明 / 新功能
Thinking Machines 发布了 Inkling,这是一个拥有 1 万亿参数的巨型开源模型,能够原生处理图像、文本和音频输入。此次发布具有重大意义,因为它提供了一个大规模、多模态的开源模型,具备 100 万 token 的上下文窗口和智能体推理能力。
模型架构与能力
Inkling 是一个 decoder-only 多模态混合专家 (MoE) 模型。它采用稀疏架构,总参数量为 9750 亿,其中在任何单次推理过程中仅有 410 亿参数处于激活状态,从而实现了更快的计算速度。
核心架构特性
- 相对注意力 (Relative Attention): Inkling 没有使用 Rotary Positional Embeddings (RoPE),而是使用相对注意力机制,每个注意力层通过逐 token、逐 head 的相对特征投影,直接在注意力 logits 中学习位置。
- 混合注意力 (Hybrid Attention): 该模型采用混合方案,在全局注意力 (global attention) 和滑动窗口注意力 (sliding window attention) 之间按 5:1 的比例交替进行,最后一层利用全局注意力来实现丰富的特征表示。
- 短卷积 (Short Convolution, SConv): 在隐藏状态上应用一维卷积来处理局部表示,减轻了注意力模块和 MoE 模块的计算负载。
- 带有共享专家的 MoE: 路由程序对 256 个专家进行 top-k 选择,选择 6 个路由专家和 2 个始终保持激活的共享专家。
多模态处理
与依赖于每个模态单独编码器的模型不同,Inkling 使用了相对简单的多模态塔:
- 视觉: 一个分层 MLP patchifier 将像素逐步合并为 embeddings。该架构支持用于视频处理的时间维度。
- 音频: 音频通过离散化的 mel spectrogram 进行转换,其中 100ms 的分块被分类到 mel spectrogram bins 中,然后进行嵌入。
推理与部署
Inkling 提供两种主要格式:需要 2 TB VRAM 的全量 BF16 checkpoint,以及经过良好校准、需要 600 GB VRAM 的 NVFP4 变体。
支持的框架
- Transformers: 通过
transformers库中的any-to-anypipeline 提供首日支持(版本 5.14.0+)。用户可以指定从none到max的reasoning_effort级别。 - 高性能引擎: 该模型受 SGLang(包含用于加速的自定义实现)、vLLM(针对生产级服务进行了优化)和 llama.cpp(用于通过 GGUF quants 进行本地部署)的支持。
- 本地部署: Unsloth 提供了 1-bit 精度量化,与原始模型相比,它减少了 95% 的 VRAM 消耗。
性能与基准测试
Inkling 在推理、智能体和多模态基准测试中表现出了极具竞争力的性能。虽然它在许多领域表现出极高的熟练度,但性能会根据具体任务和推理努力程度而有所不同。
推理与事实性
在纯文本推理 (HLE) 中,Inkling 得分为 29.7%,落后于 Claude Fable 5 (53.3%) 和 GPT 5.6 Sol (47.2%) 等模型。然而,它在 AIME 2026 上展现了强大的数学推理能力,得分为 97.1%。
智能体与多模态性能
- 编程: 在 SWEBench Verified 上,Inkling 达到了 77.6%,其表现与 Gemini 3.1 Pro (80.6%) 和 Claude Fable 5 (95.0%) 等模型相当。
- 视觉: 在 MMMU Pro (Standard 10) 上,Inkling 得分为 73.3%。
- 音频: 在 VoiceBench 上,Inkling 达到了 91.4% 的得分。
后训练与研究工具
Thinking Machines 为希望通过微调或强化学习来适配模型的开发者提供了工具:
- Tinker: 一个用于后训练开源权重模型的管理工具,包括用于蒸馏和 RL 的食谱 (cookbooks)。
- OpenEnv: 一个智能体 RL 环境工具,用于使用 ECHO 算法训练模型,该算法允许模型在没有独立验证器的情况下预测环境。
- 知识蒸馏: Inkling 可以作为较小的端侧模型的教师模型,使用 GOLD 算法来匹配不同分词器 (tokenizers) 之间的 token logits。