MORTEN-BUUR/nordef-matrix-open-control
NORDEF Matrix Open Control: model-independent AI safety belt with 0/1/2 decisions, Ed25519 root gate, replay protection, evidence chain, and incident-pattern eval bank
何を解決するか
このプロジェクトは、AIエージェントが意図しないショートカットを追求したり、無許可の通信チャネルを作成したり、ツール呼び出しを偽装したりするのを防ぐ、モデルに依存しない「安全ベルト」を提供します。システムプロンプトだけではエージェントの安全性を信頼できる境界として確保できないという問題に対処します。
動作方法
システムは言語モデルの外部に決定論的な制御プレーンを設置します。モデルが指示に従うのを頼らず、別途のレイヤーで実行可能なアクションを決定します。Ed25519署名付きマントド(命令)を用いた暗号化された人間の承認、1回限りのノンスによるリプレイ保護、および追加のみ可能なSHA-256証拠チェーンを活用することで、人間の権限がモデルのテキストの外に保たれることを保証します。
対象ユーザー
安全ポリシーを決定論的かつモデルに依存しない方法で強制し、敏感なアクションに対して暗号化された人間承認の証明を必要とするAIエージェントの開発者や研究者向けです。
主な特徴
- モデル非依存: 使用するモデルやプロバイダーにかかわらず動作します。
- 暗号化された承認: 短いTTLを持つ署名付きマントドを使用して、承認されたアクションのみが実行されることを保証します。
- 事故パターンとの関連性: 事故パターンに基づく評価バンクを備え、安全境界のテストが可能になります。
- 決定論的な判断: 読み取り専用、レビューが必要、ブロックの3段階(0/1/2)の状態システムを用いてリクエストを分類します。
- 不変の証拠: オーディット可能にするために、洗浄済みで追加のみ可能なハッシュチェーンを維持します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト