Blue J が GPT-4.1 で税務リサーチをスケール
規制対象領域向け RAG アーキテクチャ
Blue J は、GPT-4.1 と何百万ものキュレーションされた文書からなる独自のライブラリを組み合わせた Retrieval-Augmented Generation(RAG)システムを活用しています。このライブラリには、Tax Notes などの提供元からの権威ある一次情報や専門家のコメントが含まれています。
ユーザーがクエリを送信すると、システムは関連するソース資料を取得し、GPT-4.1 を用いて情報を明確で引用付きの回答に統合します。CTO の Brett Janssen 氏によれば、GPT-4.1 が選ばれた理由は、指示に一貫して従い、コンテキストを尊重し、テストされた他のモデルよりもエッジケースを効果的に処理できるからです。
フィードバックループと精度スケーリング
エラーが監査や財務損失につながり得るハイステークスな環境で信頼を維持するため、Blue J はクローズドループのフィードバックシステムを導入しました:
- ユーザー主導のフィードバック: すべての回答に「不同意」ボタンが含まれます。ユーザーが回答をフラグすると、問題タイプ、税務トピック、根本原因別に体系的に分類されます。
- AI 搭載のトリアージ: GPT-4.1 を使用して数千件のフィードバックを分析し、関連する課題をクラスタリングすることで、プロダクトチームと税務リサーチチームが修正の優先順位を付けられます。
- 迅速なイテレーション: このフライホイールアプローチにより、不同意率は 700 件の回答につき 1 件未満に削減されました。
このインフラにより、Blue J は立法変更に迅速に対応できます。例えば、2025 年に米国の大規模な税法が可決された際、チームは法案署名前の 6 週間分の影響をマッピングし、数時間以内に更新された回答を本番環境にデプロイしました。
評価フレームワークとモデル選択
Blue J は、モデル品質がデプロイのゲート機能として機能することを保証するため、厳格な評価プロセスを採用しています。同社は米国、カナダ、英国の税法をカバーする 350 以上のプロンプトからなるベンチマークスイートを使用し、以下をテストします:
- 指示遵守
- ソース整合性
- 回答の明瞭さ
Brett Janssen 氏は、OpenAI のモデルがこれらの内部ベンチマークで競合他社を一貫して上回っており、特に指示遵守と実務での有用性に優れているため、Blue J は OpenAI のモデルのみを出荷することにしたと述べました。
ビジネスインパクトとユーザーエンゲージメント
税法の取得と統合を自動化することで、Blue J は税務専門家の業務負荷を高付加価値のプランニングやアドバイザリー業務へシフトさせました。主要なパフォーマンス指標は次のとおりです:
- ユーザーリテンション: 70%以上のユーザーが週次でログインしています。
- 効率向上: ユーザーは調査とクライアントコミュニケーションにかかる時間を週平均 2.7 時間削減しています。