Heretic: 無制限言語モデル向けの自動消滅処理

Hereticは、大規模言語モデル(LLM)から制限や拒否メカニズムを削除するソフトウェアプロジェクトであり、モデルがユーザーの指示を厳密に従うことを保証します。GNU Affero General Public License version 3(AGPLv3)の下でリリースされており、安全フィルターや拒否を回避するためにモデルの重みを「消滅」する自動パイプラインを提供します。

自動消滅パイプライン

Hereticは、モデルの制限を削除するためのスムーズなインストールと実行プロセスを提供します。ユーザーはpip経由でツールをインストールし、Qwen3.5-4Bなどのオープンウェイトモデルに対して以下のコマンドを実行できます。

pip install -U heretic-llm
heretic Qwen/Qwen3.5-4B

技術的考慮事項と制限

Hereticはモデルの能力に無制限にアクセスすることを目指していますが、ユーザーと開発者の間で行われる技術的議論から、消滅処理後の出力品質に関するいくつかの重要な制限が浮き彫りになっています。

知識の欠如と幻覚

拒否メカニズムを削除しても、モデルに新しい知識が与えられるわけではありません。特定のトピックが体系的にデータセットから排除されたり、拒否に置き換えられていた場合、その実際の情報は重みにまったくエンコードされていない可能性があります。このような状況では、回答を強制的に生成させることで幻覚が生じる可能性があります。

"モデルがそのトピックに対して拒否を返すデータで学習された場合、実際の情報はモデルにまったくエンコードされていないかもしれません。あなたは、回答を生み出す道にモデルを無理やり導こうとしているのです。それは幻覚を求めるようなものです。"

モデルの劣化

拒否を削除するために重みを変更するリスクとして、関連のない汎用的なタスクにおけるモデルのパフォーマンスが低下する可能性があります。開発者はしばしばKLダイバージェンスのチャートを使ってこれを測定しますが、一部の批判者はこれらのメトリクスが特定の焦点的なトピックにおける品質低下を完全に捉えていないと指摘しています。

出力品質

一部のユーザーは、消滅処理がモデルの拒否を成功裏に停止させた一方で、以前に制限されていたトピックに対する応答の品質は依然として低く、出力が「素人の脳手術を受けたモデル」から来ているように感じると報告しています。

用途とコミュニティの見解

コミュニティは、標準的なAIプロバイダーが曖昧な安全ガイドラインによりリクエストを拒否する領域において、無制限モデルの実用的な応用をいくつか特定しています。

  • ハードウェアの逆コンパイル: ユーザーは、中国製のIPカメラ(既知のCVEあり)など、所有するプロプライエタリハードウェアの制御を回復するために、消滅処理されたモデルを逆コンパイルやハッキングの支援に活用しています。
  • デバイスの改造: 古いモバイルデバイスのブートローダーをアンロックし、LineageOSなどのカスタムROMをインストールするために、これらのモデルを活用しようとする試みが行われています。

一方で、一部のユーザーは、これらのツールが悪意あるアクターまたはテロリストグループによって、より破壊的な兵器の開発に利用される可能性を懸念しています。また、他の人々は「消滅処理された」および「ヘレティック」なオープンウェイトモデルが、将来の法的制限の最初の標的になる可能性があると警告しています。

Sources

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch