antoinezambelli/forge
A Python framework for self-hosted LLM tool-calling and multi-step agentic workflows
何を解決するか
Forge は、特に自己ホスト型のローカル LLM において、ツール呼び出し(関数呼び出し)の信頼性を高めるために設計された信頼性レイヤーです。モデルが不正な JSON を出力したり、存在しないツールを呼び出したり、特定の手順を正しく順番に実行できなかったりするといった一般的な失敗を防ぎ、エージェントワークフローがクラッシュしたり無限ループに陥ったりするのを回避します。
動作方法
Forge は、以下の3つの方法で統合可能なガードレールシステムとして機能します:
- プロキシサーバー:既存のクライアント(Aider や Claude Code など)とモデルサーバーの間に配置される即時導入型サイドカー。クライアントのコード変更なしにリクエストを透明にインターセプトし、ガードレールを適用します。
- WorkflowRunner:ツールの定義と構造化されたエージェントループを扱う高レベルなフレームワーク。システムプロンプトからコンテキストの圧縮まで、フルライフサイクルを管理します。
- Guardrails ミドルウェア:カスタムオーケストレーションループに組み込める、応答の検証や不正な呼び出しの修復を可能にする合成可能なツールセット。
主な信頼性メカニズムには、リスク回復パーサー(XML やコードフレームなどの非標準フォーマットからツール呼び出しを抽出)、応答検証(ツール名や構造のチェック)、および修正付きの自動リトライループが含まれます。
対象ユーザー
ローカル LLM に依存して AI エージェントを開発している、または既存のコードアシスタントを利用している開発者で、より大きな高価なフロンティアモデルに切り替えることなく、ツール呼び出しの成功率を向上させたい人。
特徴
- 高い信頼性向上:評価スイートにおいて、ローカル 8B モデルの成功率を桁違いの数値から 84% まで向上。
- 広範なバックエンド対応:llama-server、Ollama、vLLM、Llamafile、Anthropic に対応。
- ゼロリライト統合:プロキシモードにより、既存の OpenAI 互換ツールがガードレールの恩恵を透明に受けられる。
- コンテキスト管理:階層的圧縮などの戦略により、トークン予算を効率的に管理。
- 優先アクセス:
SlotWorkerを使用することで、複数の専門的ワークフローが単一の GPU スロットを優先キューで共有可能。
関連
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト