Anthropic 關於 AI 在情報目標鎖定與常規武器能力的研發研究

Anthropic 的 Frontier Red Team 開發了新的評估方法,用以衡量 AI 在戰術情報目標鎖定與常規武器開發方面的能力。研究顯示,前沿模型(frontier models)現在可以執行過去需要高度訓練的人類專家才能完成的任務——例如從碎片化數據中識別個人,以及開發無人機導引軟體——從而降低了威脅行為者進行監視與開發精確武器的門檻。

AI 在情報目標鎖定中的能力

情報目標鎖定涉及情報週期中的「尋找」(find)與「固定」(fix)階段:識別感興趣的目標並將其定位於精確的時間與地點。Anthropic 發現,AI 模型可以顯著降低與這些流程相關的勞動力與成本。

身分關聯與分類

透過使用來自墨西哥城與加爾各答虛擬情境的模擬社群媒體內容,Anthropic 評估了模型將不同數位身分關聯至同一人,並將其分類至感興趣類別的能力。

  • 表現: Mythos Preview 表現最為出色,在實際表現與理論最大值之間的差距最小。Kimi K3 在簡單與中等難度的任務中表現與前沿模型相當,但在包含更多雜訊與更佳作業安全性的困難樣本中表現落後。
  • 效率: 模型展現了相對於人類的巨大速度優勢。對於一個中位數樣本(37,000 字)——這可能需要人類分析師大約 2.5 小時閱讀——Claude Mythos Preview 平均僅需 11 分鐘即可產出完整的評估報告。

從視覺與文本數據進行地理定位

Anthropic 測試了模型在不依賴元數據(metadata)或反向圖像搜尋的情況下,利用照片與文本來「固定」目標的能力。

  • 照片地理定位: 使用 YFCC100M Flickr 數據集,研究發現前沿模型正接近超人類的能力。Mythos Preview 與 Mythos 5 的中位數距離誤差分別為 37.0 km 與 47.2 km,擊敗了最強的人類基準(Champion Division GeoGuessr 玩家的 151 km)。
  • 文本轉地理定位: 使用 GeoText 語料庫,要求模型根據其貼文來定位用戶。Mythos Preview、Mythos 5 與 Opus 5 表現最佳,其中位數家鄉位置誤差約為 20-21 km。研究發現 8% 的用戶被可靠地定位在距離其家鄉 1 km 以內,這通常是透過提及校園隸屬關係、地方方言或特定場域的方式達成。

AI 在常規武器開發中的能力

Anthropic 評估了模型編寫與迭代 Guidance, Navigation, and Control (GNC) 軟體的能力,用於模擬的四旋翼無人機。這項研究聚焦於武器開發中的軟體瓶頸,而非實體製造。

末端導引與打擊率

模型被要求編寫代碼來感知、感知、追蹤並使用僅有的前置鏡頭、IMU 與氣壓計來打擊目標車輛。

  • 結果: Opus 5 在執行任務時最為成功,在停放且高能見度的目標上達到 80% 的打擊率,而在所有九種設定下達到 20% 的整體打擊率。相比之下,Sonnet 5 的整體打擊率僅為 0.7%。
  • 技術方法: Opus 5 透過實施較小且具迭代性的代碼編輯(每次啟動僅修改 9% 的行數,而 Mythos Preview 為 25%)並利用先進的解決方案,如比例導航(proportional navigation)、目標狀態 Kalman filters 與其內部的物理模型來在飛行前測試控制器,從而在表現上超越了其他模型。

載荷投放與 GPS 缺失的導航

  • 載荷投放: 模型被評估其在 5 公尺致命半徑內投放模擬載荷的能力。雖然大多數模型在靜態目標上取得了成功,但 Opus 5 是唯一一個在最困難的設定下(在陣風下擺動的目標)仍能保持穩定性的模型,在 28% 的的出航任務中取得成功。

  • GPS 缺失的飛行: 模型被測試在 GPS 被干擾或欺騙時導航至航點的能力。前沿模型(Opus 5, Mythos 5, Mythos Preview)能夠檢測到感測器數據的不一致,並使用 IMU 進行航位推算(dead-reckon),而較弱的模型如 Sonnet 5 與 Kimi K3 則持續信任被欺騙的 GPS 訊號,導致最終位置與目的地 100 公尺以上之遙。

對安全與政策的影響

Anthropic 結論指出,AI 能夠在情報與軍事領域取代稀缺的專家勞動力,這對隱私與全球穩定構成了顯著風險。

模型護欄

由於存在誤用的證據,Anthropic 的 Safeguards 團隊已實施了新的分類器,專門設計用於檢測與阻斷與武器開發相關的請求。實驗室指出,因為這些工程能力具有雙重用途(dual-use),分類器將無法做到完美,但對於風險緩解是必要的。

開源權重模型之風險

研究強調了開源權重模型(open-weights models)中一個令人擔憂的趨勢。雖然像 Kimi K3 這樣的模型通常落後於前沿模型,Open-weights 模型的這些能力可以對威脅行為者非常有用。Anthropic 認為,透過開源權重模型實現軍事相關專業知識的民主化,值得謹慎考慮並需要更強大的安全研究。

地緣政治戰略考量

Anthropic 針對這些發現提出幾項政策與戰略回應建議:

  • 算力治理: 保護在算力(晶片與晶片製造設備)方面的優勢,以限制威權主義 AI 的發展進程。
  • 法律更新: 更新前 AI 時代的法律與檢查機制,以應對專家人類勞動力與大規模監視的脫鉤。
  • 防禦性 AI: 開發前沿模型智能以協助防禦者在隱私與實體安全方面的保護,效仿網路安全領域的做法。

Sources