Hugging Face のローカルモデルによる OpenClaw PR トリアージ
Hugging Face のローカルモデルによる OpenClaw PR トリアージ
Hugging Face は、ローカルのオープンウェイトモデルを使用して OpenClaw リポジトリ向けのリアルタイム通知およびトリアージシステムを実装しました。Gemma 4 や Qwen 3.6 といったモデルをエージェントハーネス内にデプロイすることで、高スループットな Issue と Pull Request(PR)の分類を、コストのかかるクローズドモデル API に依存せず、バッチ処理のためにリアルタイム性を犠牲にすることなく実現しました。
エージェント型分類アーキテクチャ
このシステムは「エージェント型分類」を利用します。モデルは単にプロンプトを受け取るだけでなく、構造化された結果を返す前に追加のコンテキストを能動的に取得できます。主なコンポーネントは次のとおりです。
- エージェントハーネス: システムはハーネスとして Pi を使用し、ローカルモデルエンドポイントを呼び出します。
- 制限付きシェル (reposhell): 悪意ある PR や Issue からのプロンプトインジェクション攻撃を防ぐため、エージェントはフル Bash アクセスを持ちません。代わりに
reposhellという制限付きシェルを使用し、OpenClaw リポジトリ上で読み取り専用操作(例:ls,find,cat,grep)のみを許可します。 - 構造化出力: エージェントは
final_jsonツールを使って、事前定義されたカテゴリ(例:local_models,self_hosted_inference,agent_runtime)に基づく最終分類ラベルを提出します。
オーケストレーションパイプライン
GitHub イベントから Discord 通知までのワークフローは、速度とリソース効率を最大化するために半エージェント的な経路をたどります。
- ミラーリング:
openclaw/gitcrawlがリポジトリをローカルにミラーし、新しい PR と Issue を SQLite データベースに正規化します。 - コンテキスト構築: ワーカーがタイトル、本文、ラベル、差分抜粋を含む GitHub コンテキストオブジェクトを作成し、モデルが直接 GitHub を参照する必要性を減らします。
- 推論:
localpager-agentがプロンプトを処理します。エージェントは必要に応じてreposhellを使用し、コードベースを検査して精度を向上させた上で最終的な JSON 分類を出力します。 - 通知: 決定論的ルールにより、分類された項目がユーザー定義の通知ポリシーに基づき Discord にルーティングされます。
モデル性能とベンチマーク
テストは、GPT-5.5 と Opus 4.8 のコンセンサスでラベル付けされた 330 行の評価セットで実施しました。モデルは NVIDIA GB10(統合メモリ 128 GB)上で実行されました。
| Metric | gemma-4-26b-a4b |
qwen3.6-35b-a3b |
DeepSeek-V4-Flash |
|---|---|---|---|
| 精度 | 0.716 ± 0.010 | 0.831 ± 0.007 | 0.938 |
| 再現率 | 0.905 ± 0.004 | 0.818 ± 0.006 | 0.714 |
| F1 | 0.800 ± 0.008 | 0.824 ± 0.002 | 0.811 |
| 完全一致 | 0.410 ± 0.014 | 0.540 ± 0.014 | 0.509 |
| 偽陽性 | 227.0 ± 10.5 | 105.7 ± 6.4 | 30 |
| 偽陰性 | 60.0 ± 2.6 | 115.3 ± 4.0 | 181 |
| 行あたりの実時間秒 | 1.41 ± 0.04 | 13.51 ± 0.79 | 144.14 |
| 出力トークン/秒 (合計) | 402.6 | 145.3 | 13 |
| 総パラメータ数 | 26B | 35B | 284B |
| アクティブパラメータ数 | 4B | 3B | 13B |
主な所見:
- Gemma 4 (26b-a4b): 最高の再現率と最速の行あたり実時間を示しました。vLLM と NVFP4 量子化を使用した別途のベンチマークで、1 秒あたり 700 トークン以上の集計出力トークンを達成しています。
- Qwen 3.6 (35b-a3b): Gemma よりも高い精度と、偽陽性が少ないことが確認されました。
- DeepSeek-V4-Flash: 偽陽性率は最も低いものの、サイズと低スループット(13 トークン/秒)により、指定ハードウェア上でのリアルタイムローカル実行は実用的ではありませんでした。
検証とリアルタイム監査
ローカルシステムの妥当性を確認するため、Hugging Face は OpenClaw 経由で GPT-5.5 を使用した並列監査ループを 2 時間ごとに実行します。この最先端モデルがジャッジ役となり、ローカルモデルが生成した偽陽性・偽陰性を特定します。この監査プロセスのコストは月額約 $9 で、ローカル分類器の信頼性を保つためのキャリブレーション手段として機能します。
高スループットトリアージへの広範な示唆
本実装は、中規模ローカルモデルでもゼロショット分類を十分な精度で実行でき、コストのかかるクラウド API を置き換えて高ボリュームのフィルタリングタスクに対応できることを示しています。チームは、この「エージェント型分類」アプローチ(高速ローカルモデルと制限付きツールアクセスの組み合わせ)を、ニュースカテゴリ分け、カスタマーサポートチケットのトリアージ、コンテンツモデレーションの訴求処理など、他の領域にも応用できると提案しています。