Moonshot AI 被指控透過蒸餾 Anthropic 的 Fable 來開發 K3 模型
Moonshot AI 被指控透過蒸餾 Anthropic 的 Fable 來開發 K3 模型
Moonshot AI 被指控蒸餾 Anthropic 的 Fable 模型
主任 Michael Kratsios 表示,Moonshot AI 是透過蒸餾 Anthropic 的 Fable 來開發其 K3 模型。根據 Kratsios 的說法,Moonshot AI 建立了一個精密的內部平台,旨在針對美國模型進行大規模蒸餾。據報導,該平台允許該公司在多種訪問方法之間快速切換,以避免被目標模型的提供者發現。
除了軟體基礎設施外,Kratsios 指出,Moonshot AI 已購置配備 GB300 GPU 的伺服器,並透過泰國訪問 GB300,以促進其 AI 模型的訓練。
美國政府對 AI 蒸餾的立場
雖然美國支持具競爭力的 AI 生態系統——包括開源框架和開放權重模型——但政府對合法蒸餾與隱蔽蒸餾進行了區分。
- 合法蒸餾: 用於創建更小、更高效的模型,以促進開放創新。
- 隱蔽工業蒸餾: 被 Kratsios 描述為企圖竊取美國專有技術並破壞美國研究的行為,這被認為是「不可接受的」。
技術與經濟辯論
這些指控引發了關於模型蒸餾的技術可行性和經濟影響的重大討論。
技術可行性與時機
一些觀察人士對 K3 發布的時間表提出了質疑。Kimi K3 於 7 月 16 日發布,而 Fable 的禁令於 7 月 1 日解除,且訪問權限仍受到限制。批評者認為,在 Fable 可用與 K3 發布之間的窗口期太短,不足以進行大規模的蒸餾、訓練、基準測試和完整的產品發布。
此外,技術討論強調,真正的蒸餾通常需要訪問 token 的機率分佈 (logits),而前沿實驗室並不提供這些數據。因此,在此背景下的「蒸餾」可能指的是使用較大的模型來生成合成數據,或對較小模型的輸出進行評分,透過監督式微調 (SFT) 或直接偏好優化 (DPO) 來提高其性能。
對前沿實驗室的經濟影響
分析師認為,像 Anthropic 和 OpenAI 這樣公司的經濟可行性取決於他們對尖端 (SOTA) 模型訪問收取溢價的能力。如果競爭對手可以利用蒸餾以極低的研發成本實現類似的性能,那麼 SOTA 訪問的市場價格可能會下降,這可能會降低前沿實驗室投入數億美元進行高品質合成數據生成的動力。
法律與倫理觀點
社群對這些指控的反應存在嚴重分歧,核心在於 AI 訓練中的「公平性」概念。
反對指控的論點
許多人認為蒸餾是標準的行業慣例,並不違法。提出的一些觀點包括:
- 與網絡爬蟲的類比: 如果為了訓練而爬取受版權保護的材料被認為是合法的,那麼蒸餾模型輸出也應同樣被允許。
- AI 輸出缺乏版權: 由於 AI 生成的文本通常不受版權保護,有些人認為將其用於訓練是對可用數據的合理使用。
- 行業先例: 一些用戶聲稱,前沿實驗室本身也會從各種來源進行蒸餾,以改進他們自己的模型。
支持保護的論點
其他人認為隱蔽蒸餾是一種工業間諜行為。他們認為,如果前沿模型的輸出可以輕易地被「抽走」來創建競爭產品,那麼創新的動力將消失,導致 AI 能力停滯。
「如果他們的輸出會立即被用來訓練競爭模型,誰還會投資於生成 AI 前沿領域的數據?... 如果其他公司要搭便車,那麼繼續投資就沒有意義了。」
關鍵主張摘要
| 主張 | 來源/細節 |
|---|---|
| 主要指控 | Moonshot AI 為了 K3 的開發而蒸餾了 Anthropic 的 Fable |
| 方法 | 用於規避檢測的精密內部平台 |
| 硬體 | 使用配備 GB300 的伺服器並透過泰國訪問 |
| 美國立場 | 隱蔽的工業蒸餾是不可接受的 |