Moonshot AI 被指控为 K3 模型蒸馏 Anthropic Fable
Moonshot AI 被指控为 K3 模型蒸馏 Anthropic Fable
Moonshot AI 被指控蒸馏了 Anthropic 的 Fable 模型
Michael Kratsios 主席表示,Moonshot AI 通过蒸馏 Anthropic 的 Fable 来开发其 K3 模型。根据 Kratsios 的说法,Moonshot AI 构建了一个复杂的内部平台,专门用于对美国本土模型进行大规模蒸馏。据报道,该平台使公司能够在多种访问方式之间快速切换,以避免被目标模型提供方发现。
除了软件基础设施,Kratsios 还指出,Moonshot AI 已经采购了配备 GB300 GPU 的服务器,并在泰国访问了 GB300 以便进行其 AI 模型的训练。
美国政府对 AI 蒸馏的立场
虽然美国支持竞争性的 AI 生态系统——包括开源框架和开放权重模型——但政府区分了合法蒸馏和隐蔽蒸馏。
- 合法蒸馏: 用于创建更小、更高效的模型以促进开放创新。
- 隐蔽工业蒸馏: Kratsios 将其描述为试图窃取专有的美国技术并削弱美国研究的行为,被认为是“不可接受的”。
技术与经济争论
这些指控引发了关于模型蒸馏的技术可行性和经济影响的广泛讨论。
技术可行性和时机
一些观察者对 K3 发布的时间线提出质疑。Kimi K3 于 7 月 16 日发布,而 Fable 的禁令于 7 月 1 日解除,访问仍然受限。批评者认为,Fable 可用性与 K3 发布之间的时间窗口太短,无法进行大规模蒸馏、训练、基准测试和完整产品发布。
此外,技术讨论指出,真正的蒸馏通常需要访问 token 上的概率分布(logits),而前沿实验室并不提供这一点。因此,在这种情况下,“蒸馏”很可能指的是使用更大的模型来生成合成数据或对较小模型的输出进行评分,以通过监督微调(SFT)或直接偏好优化(DPO)提升其性能。
对前沿实验室的经济影响
分析师认为,像 Anthropic 和 OpenAI 这样的公司的经济可行性取决于他们对最先进(SOTA)模型访问收取溢价的能力。如果竞争对手能够通过蒸馏以仅仅是研发成本的一小部分达到类似性能,那么 SOTA 访问的市场价格可能会下降,从而可能降低前沿实验室投资数亿美元生成高质量合成数据的动机。
关于合法性和伦理的观点
社区对这些指控的反应存在深刻分歧,围绕 AI 训练中的“公平性”概念展开。
反对指控的论点
许多人认为蒸馏是行业标准做法且不违法。提出的一些观点包括:
- 与网页抓取的类比: 如果为了训练而抓取受版权保护的材料被视为合法,那么蒸馏模型输出也应同样被允许。
- AI 输出缺乏版权: 由于 AI 生成的文本通常不可受版权保护,因此将其用于训练被一些人视为对可用数据的合理使用。
- 行业先例: 一些用户声称,前沿实验室本身也会从各种来源进行蒸馏以改进自己的模型。
支持保护的论点
其他人则认为隐蔽蒸馏是一种工业间谍行为。他们指出,如果前沿模型的输出可以轻易被“虹吸”以创建竞争产品,创新的动机将消失,导致 AI 能力停滞。
"谁会为 AI 前沿生成数据,如果他们的输出会立即被用来训练竞争模型?... 如果其他公司要免费搭乘这项投资,那就没有继续下去的意义了。"
关键主张摘要
| 主张 | 来源/细节 |
|---|---|
| 主要指控 | Moonshot AI 蒸馏了 Anthropic 的 Fable 以开发 K3 |
| 方法 | 复杂的内部平台以规避检测 |
| 硬件 | 使用配备 GB300 的服务器以及通过泰国访问 |
| 美国立场 | 隐蔽工业蒸馏是不可接受的 |