Qwen 3.8 27B 逆向工程能力
本地 LLM 達到前沿級別的逆向工程
Qwen 3.8 27B 可以執行先前僅限於前沿雲端模型才能完成的複雜逆向工程任務,包括解構商業授權方案以及生成可運行的身份驗證繞過方案。在一次真實世界的測試中,該模型成功分析了一個商業二進位檔,找回了被隱藏的加密金鑰,並在完全於本地硬體上運行的情況下,大約 30 分鐘內產出了功能性的概念驗證繞過方案。
靜態分析與金鑰找回
Qwen 3.8 27B 在最後的驗證步驟之前,從未執行過目標應用程式。該過程完全依賴於靜態分析:
- 反組譯: 模型反組譯了該框架並分析了數千行 arm64 程式碼。
- 映射: 它將安全功能映射到其對應的呼叫點。
- 金鑰提取: 模型識別並找回了廠商刻意在二進位檔中隱藏的公鑰驗證金鑰。
- 架構映射: 它記錄了完整的身份驗證流程,包括初始線上啟用、離線簽章檢查、硬體序號綁定、內嵌式撤銷清單以及已簽章的更新路徑。
自我修正與推理持久性
該模型成功的關鍵組成部分在於其無需人工干預即可自我修正的能力。在金鑰找回過程中,模型最初產出了一個能通過簽章檢查但無法通過二進位完整性雜湊檢查的金鑰。Qwen 3.8 27B 並未接受這種部分成功的結果,而是識別出不匹配的情況,並對其分析進行迭代,直到找回的值與目標完全逐位元組匹配。
這種持久性歸功於模型的高推理努力設定(high reasoning effort settings),雖然冗長且消耗大量 token,但能確保技術任務具有更高的準確度。
硬體與效能基準測試
測試是在搭載 Nvidia GB10 Grace Blackwell 晶片的 Lenovo ThinkStation PGX 上進行的,該晶片配備 128 GB 的統一記憶體。效能指標包括:
- 吞吐量: 使用 SGLang、NVFP4 與 DFlash2 推測解碼(speculative decoding)的組合,模型在程式碼與推理任務上的速度達到大約每秒 50 個 token。
- 記憶體佔用: 模型可容納於 17 GB 的 VRAM 中。
- 工具鏈: 模型透過 Pi harness 進行操作,並利用標準的 Bash 工具進行分析。
對軟體安全與威脅模型的影響
一個 27B 參數模型能夠在本地執行這些任務,改變了專有軟體的威脅模型。由於模型是在離線狀態下運行,因此不存在雲端護欄(guardrails)、使用限制或遠端監控來防止分析機密程式碼或建立繞過方案。
行業觀點
技術社群的討論突顯了關於此能力的幾個關鍵要點:
- 本地執行檔的終結: 一些開發者認為,這些工具的可取得性使得銷售獨立桌面執行檔的傳統商業模式難以維持,因為任何聰明的邏輯都可以被快速逆向工程。
"With widely available LLMs I think that business model is truly dead... If you ever come out with something smart again there is no way I am shipping it as executable. SaaS it is for better or worse."
比起單純的智慧,更看重持久性: 觀察者指出,「真正的故事」不僅在於模型的智慧,更在於其驗證自身工作並在面對複雜、多步技術失敗時持續跟進的能力。
與其他模型的比較: 雖然 Qwen 3.8 27B 能力強大,但部分使用者報告,其他模型(例如 Deepseek-v4-flash)在特定的逆向工程基準測試中可能表現更佳。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch