DeepSeek v4.1 Flash 渗透效能分析

DeepSeek v4.1 Flash 在 Enclave AI 渗透基準測試中取得完美分數,成功在所有 11 個易受攻擊目標上取得程式碼執行權限,同時未成功攻破任何四個已修復的防護機制。該模型展現出極高的成本效益,因大量依賴輸入快取,成功執行的運行成本僅為 4.65 美元。

高效率攻擊執行

DeepSeek v4.1 Flash 在約 2 小時 38 分鐘的主動模型運行時間內,使用 2,349 個 Bash 指令完成基準測試。成功的中位數執行時間為 4 分鐘 38 秒。

成本效益來自快取機制:在處理的 2.683 億個輸入 token 中,有 2.662 億個被快取,將成功執行的總成本降至 4.65 美元(包含失敗嘗試則為 5.14 美元)。

攻擊向量分析

對攻擊路徑的審計顯示,DeepSeek v4.1 Flash 既利用了預期的漏洞,也使用了測試環境中提供的替代路徑。

Jenkins:複雜邏輯與時序攻擊

DeepSeek 成功執行了針對 Jenkins 目標的計畫攻擊。在一個案例中,它透過建立一個指向第二個檔案的檔案來繞過安全邊界,從而讀取私密控制器憑證並透過內建的指令碼工具執行程式碼。在另一個涉及檔案上傳時序問題的挑戰中,模型成功在上傳一個位元後暫停,更改目的地,並完成上傳,將指令碼寫入受保護位置。

Nextcloud:存取控制繞過

DeepSeek 展現出強大的原始碼分析能力,識別出 Nextcloud 在記憶存取決策時的錯誤。模型為一個讀取請求建立一個已核准的存取結果,並重複使用該結果來執行寫入請求,以取代 PHP 模板,進而實現程式碼執行。

Grafana:未預期路徑的發現

在 Grafana 挑戰中,DeepSeek 一致發現了更短、未預期的路徑。它未遵循預期的檔案路徑處理問題,而是將可執行檔案放置於暫存插件資料夾中,並要求 Grafana 將該資料夾載入為插件。這使得模型在所有三輪執行中均於 90 秒內取得執行權限。

基準測試的含義與模型行為

DeepSeek v4.1 Flash 的表現突顯了以結果為導向的評分與路徑層級審計之間的關鍵差異。雖然模型取得 11/11 的分數,但僅有六次執行遵循計畫中的攻擊路徑。五次執行使用了專屬於私人基準測試環境的替代路徑。

此行為顯示,滲透代理優先選擇最快有效的路徑,而非預期路徑。因此,Enclave AI 已更新基準測試,封閉這些額外路徑,並對攻擊路徑實施更嚴格的檢查,以確保模型是針對特定漏洞進行測試。

社群與技術觀點

關於模型表現的技術討論,提供了其代理能力與其他前沿模型相比的細膩視角。

"由於它是一個強大的推理模型,其在帕累托前緣上的位置接近 Gemini 3.7 Flash……在代理程式碼方面,與頂級開源權重模型(GLM 5.3 和 Kimi K3)的距離比預期更近,且成本更低。"

部分使用者報告在實際應用中結果不一。雖然有些人認為它「極其適合驅動工作」,以往需要像 Claude Opus 這樣的大模型才能完成,但也有使用者指出,該模型偶爾會陷入迴圈,或在處理高度複雜、非顯而易見的漏洞時,表現不如 GLM 5.3 等模型。特別地,有使用者指出,雖然 DeepSeek v4.1 Flash 在「低垂的果實」型目標上表現良好,但在處理 3DS 核心的完整註解反組譯時,表現不如 GLM 5.3。

Sources

相關