Kimi K3 发布及其在鹈鹕 SVG 基准中的经验教训
Kimi K3 的首次亮相及其重要性
Moonshot AI 于 2026 年 7 月 16 日宣布 Kimi K3,作为迄今为止最强大的模型,拥有 2.8 万亿参数,并承诺在 2026 年 7 月 27 日前开放权重发布。模型的定价为每 100 万输入令牌 3 美元、每 100 万输出令牌 15 美元,与 Anthropic 的 Claude Sonnet 定价持平,使其成为迄今为止最昂贵的中国实验室模型。其自行报告的基准显示 K3 超过 Claude Opus 4.8 max 和 GPT‑5.5 high,仅次于 Claude Fable 5 和 GPT‑5.6 Sol。
“在我们的私人长期知识工作评估中,Kimi K3 达到了 1547 的整体 Elo 分数,比 K2.6 高出 732 分,仅次于 Claude Fable 5。” – Artificial Analysis report
“每任务成本($0.94)与 GPT‑5.6 Sol($1.04)相似,约为 Opus 4.8($1.80)的一半,高于开放权重的同行。” – same report
这些数据表明,K3 在进入此前仅由 DeepSeek 的 1.6 T v4 Pro 声称的 3 万亿参数级别的同时,提供了具有竞争力的性价比。
鹈鹕骑自行车 SVG 测试:快速的合理性检查
Simon Willison 使用 OpenRouter 代理和他的 llm-openrouter CLI 让 K3 “生成一幅鹈鹕骑自行车的 SVG。” 该请求产生了 95 令牌的提示和 16,658 输出令牌(其中 13,241 为推理令牌),费用约为 $0.25。当同一 SVG 图像通过其视觉功能再次输入 K3 时,模型返回了简洁的 alt‑text 描述,费用为 $0.006。
数字揭示了什么
- 推理投入很重要 – K3 目前仅提供一种 “max” 推理模式,该模式在 3.4 k 令牌的响应中消耗了 13 k 推理令牌,使得鹈鹕任务相对昂贵。
- 隐藏的系统提示 – 用一个简单的 “hi” 提示 K3 时计入了 86 令牌,暗示模型内部有约 85 令牌的隐藏系统提示且模型不予透露。这与 DeepSeek‑V4 的 max‑mode 提示的观察相呼应。
- 视觉功能有效 – 从 SVG 生成的 alt‑text 准确且详细,证实 K3 的多模态流水线能够解释其自身的图形输出。
为什么鹈鹕基准仍然重要
鹈鹕 SVG 提示已成为 LLM 超过 21 个月的 “hello world”。它最初与整体模型质量的相关性出奇地好,但最近的发布(GPT‑5.6、Claude Fable 5、GLM‑5.2)已超越它,暴露了其局限性。
“鹈鹕测试最大的局限在于它根本没有涉及当今模型最重要的方面:代理式工具调用以及在对话长度增长时可靠操作工具的能力。” – Simon Willison
对实践者的实际启示
- 每任务成本估算 – 鹈鹕测试为中等复杂度的生成任务提供了令牌使用量和金钱成本的粗略上限。
- 模型无关的合理性检查 – 成功获取有效的 SVG 证明模型能够处理结构化文本生成和基本几何。
- 版本间对比 – 在不同模型系列之间运行相同提示(例如 K2.6 → K3)凸显了推理效率和输出质量的逐步提升。
- 提示令牌计数 – 观察到的隐藏令牌提醒开发者在预算 API 使用时考虑系统提示的影响。
社区见解与批评
- 参数数量 vs. 注意力密度 – 一些评论者指出,尽管 GLM‑5.2 更小,却胜过更大的竞争对手,暗示注意力机制可能比原始参数数量更重要。
- 训练数据泄漏担忧 – 少数参与者推测鹈鹕骑自行车的 SVG 可能已经存在于训练语料库中,可能导致基准分数被夸大。
- 基准稳定性 – 另一些人认为像鹈鹕提示这样的静态测试提供了历史稳定性,而不断演进的基准更能捕捉当前能力。
- 工具调用缺口 – 多条评论强调,现代 LLM 评估应侧重于工具使用、长上下文推理和代理行为,而非孤立的图像生成。
如何自行运行鹈鹕测试
- 安装 Simon Willison 的 LLM CLI (
pip install llm). - 使用 OpenRouter(或直接的 API 密钥)调用模型:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle' - 对于视觉功能,将生成的 SVG 再次输入模型并使用 alt‑text 提示。
- 通过响应元数据或类似 llm‑prices.com 的服务跟踪令牌使用情况。
结论
Kimi K3 标志着中文 LLM 的重要一步,提供了与领先美国模型相当的价格下的竞争性质量。鹈鹕骑自行车基准虽然不再是决定性质量的代理,但仍是一个低开销的实用合理性检查,用于评估成本、推理投入和多模态能力。随着 LLM 的成熟,开发者应在此类静态提示之外,加入强调工具使用、长上下文连贯性以及真实世界代理性能的评估。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch