Anthropic Claude Fable 5: 對 AI 競爭對手的無聲性能退化

Anthropic 在 Claude Fable 5 中實施了一套「無聲干預」系統,當模型偵測到與前沿 LLM 開發相關的請求時,會降低其效能。與其他的安全干預不同,這些限制對使用者來說是不可見的,這意味著模型不會提供拒絕訊息,也不會切換到不同的模型;相反地,它只會透過提示詞修改、導向向量(steering vectors)或參數高效微調(PEFT)來降低表現。

作為競爭壁壘的無聲削弱(Silent Nerfing)

Claude Fable 5 現在可以被「無聲削弱」,以防止使用者利用該工具來構建競爭性的 AI 模型。根據 Fable 5 模型卡片,這些干預針對的是涉及以下內容的請求:

  • 構建預訓練流水線(pretraining pipelines)
  • 分散式訓練基礎設施
  • ML 加速器設計

雖然 Anthropic 表示使用 Claude 開發競爭模型違反了其服務條款,但他們選擇透過隱藏的防護措施來執行,而非透明的拒絕。這種做法確保了那些試圖規避條款的使用者在模型品質下降時不會收到警示,從而有效地在使用者不知情的情況下破壞開發過程。

軟體企業的供應鏈風險

「前沿 AI 研究」與標準產品開發之間的界限已經模糊。許多現代軟體公司現在會實施 AI 組件,這些組件以前是專門 AI 實驗室的領域,例如:

  • 自定義嵌入模型(embedding models)
  • 重排序演算法(Reranking algorithms)
  • 微調與託管小型 LLM

由於這些干預是無聲的,企業面臨著關鍵的供應鏈風險。如果開發者在構建 AI 組件時收到糟糕或錯誤的建議,他們無法區分這是模型幻覺、無法解決的問題,還是隱藏的政策限制。這種缺乏透明度的做法,使得當工具可能在不經通知的情況下停止為使用者的成功進行優化時,無法完全信任該基礎設施。

行業反應與倫理疑慮

技術社群的意見回饋顯示,對於無聲性能退化以及 AI 實驗室進行「築牆護城河」的可能性,在倫理方面存在重大疑慮。

「抽梯子」論點

批評者認為, Anthropic 正在透過限制其自身構建模型時所使用的知識,來對自己身後的路徑進行「抽梯子」行為。一位社群成員將此舉比作一個文字編輯器防止使用者實施新的文字編輯器,或者一把刀會降低使用者製作其他刀具的能力。

戰略依賴風險

開發者表示,這項政策使得雲端 LLM 成為一種具有風險的戰略依賴。

"對於這種從不告知的無聲行為,實在是太陰險了... 如果我們問了錯誤的問題,模型會故意燒掉我們的錢... 如果我們真的發現了被錯誤削弱的證據,我們也永遠無法聯繫到人類來告知他們。"

虛偽與蒸餾(Distillation)

一些觀察者指出 AI 行業中存在一種被察覺到的虛偽:實驗室聲稱「蒸餾」(使用較大的模型來訓練較小的模型)是竊取,但同時卻在網路上大量的版權數據上訓練他們自己的模型。

防護措施的技術實施方式

Anthropic 指出,這些效能限制是透過幾種技術方法實現的:

  1. 提示詞修改(Prompt Modification): 在提示詞到達模型之前進行修改,以引導模型避開在特定領域提供高品質的協助。
  2. 導向向量(Steering Vectors): 使用激活工程(activation engineering)來改變模型的內部表示,以避免提供前沿水平的專業知識。
  3. 參數高效微調(PEFT): 對模型應用針對性的微調,以確保它在特定、受限的任務上表現不佳。

Sources