Qwen 3.8 27B のリバースエンジニアリング能力

ローカルLLMが最先端レベルのリバースエンジニアリングを実現

Qwen 3.8 27Bは、従来は最先端のクラウドモデルに限られていた複雑なリバースエンジニアリングタスクを実行でき、商業的なライセンス方式の分解や動作する認証バイパスの生成が可能です。実際のテストでは、このモデルは商用バイナリを分析し、隠蔽された暗号鍵を回復し、約30分で動作するプロトタイプバイパスを生成しました。このすべてがローカルハードウェア上で実行されました。

静的解析と鍵の回復

Qwen 3.8 27Bは、最終的な検証ステップを除いて、ターゲットアプリケーションを一度も実行せずにバイパスを達成しました。このプロセスは完全に静的解析に依存していました。

  • ディスアセンブリ: モデルはフレームワークをディスアセンブルし、数千行のarm64コードを分析しました。
  • マッピング: セキュリティ関数をそれぞれの呼び出し場所にマッピングしました。
  • 鍵の抽出: ベンダーがバイナリ内に意図的に隠蔽した公開検証鍵をモデルが特定し、回復しました。
  • アーキテクチャのマッピング: 初期のオンラインアクティベーション、オフライン署名チェック、ハードウェアシリアル番号のバインディング、埋め込まれた失効リスト、署名付きアップデートパスを含む、完全な認証フローを文書化しました。

自己修正と推論の継続性

モデルの成功の鍵となったのは、人間の介入なしに自己修正できる能力です。鍵回復プロセス中、モデルは署名チェックは通過するがバイナリの整合性ハッシュチェックに失敗する鍵を最初に生成しました。部分的な成功を受け入れるのではなく、Qwen 3.8 27Bは不一致を識別し、回復された値がターゲットとバイト単位で一致するまで分析を繰り返しました。

この継続性は、モデルの高い推論努力設定に起因しています。これは冗長でトークン消費が大きいですが、技術的タスクにおいてより高い正確性を保証します。

ハードウェアとパフォーマンスベンチマーク

テストは、NvidiaのGB10 Grace Blackwellチップを搭載したLenovo ThinkStation PGX、128 GBのユニファイドメモリで実施されました。パフォーマンス指標は以下の通りです:

  • スループット: SGLang、NVFP4、DFlash2の推測デコードを組み合わせることで、コードおよび推論タスクで約50トークン/秒の速度を達成しました。
  • メモリフットプリント: モデルは17 GBのVRAMに収まります。
  • ツールキット: モデルはPiハーネスを介して動作し、分析には標準的なBashベースのツールを使用しました。

ソフトウェアセキュリティと脅威モデルへの影響

27Bパラメータのモデルがこれらのタスクをローカルで実行できるようになったことで、プロプライエタリソフトウェアの脅威モデルが変化しました。モデルがオフラインで動作するため、クラウドベースのガードレール、使用制限、リモート監視が存在せず、機密コードの分析やバイパスの作成を防ぐことはできません。

業界の見解

技術コミュニティの議論では、この能力に関するいくつかの重要な教訓が浮き彫りになっています:

  • ローカル実行可能ファイルの終焉: 一部の開発者は、これらのツールが広く利用可能になったことで、単体のデスクトップ実行可能ファイルを販売する従来のビジネスモデルは成り立たなくなると主張しています。なぜなら、どんなスマートなロジックも迅速にリバースエンジニアリングされてしまうからです。

"広く利用可能なLLMがある今、このビジネスモデルは本当に終わりです… もしまたスマートなものを出したら、実行可能ファイルとして配布するつもりはありません。SaaSにするしかないでしょう、良いか悪いかは別として。"

  • 純粋な知能よりも継続性: 観察者たちは、「本当の物語」はモデルの知能そのものではなく、自身の作業を検証し、複雑なマルチステップの技術的失敗に立ち向かって最後までやり遂げられる能力にあると指摘しています。

  • 他のモデルとの比較: Qwen 3.8 27Bは非常に優れた能力を持っていますが、一部のユーザーはDeepseek-v4-flashなどの他のモデルが特定のリバースエンジニアリングベンチマークではより優れたパフォーマンスを発揮する可能性があると報告しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch