Blue J 使用 GPT-4.1 擴展稅務研究

Blue J 開發了一個稅務研究引擎,使用 GPT-4.1 與檢索增強生成(RAG)技術,自動將繁雜的法規合成為專家級的答案。此系統讓稅務專業人員能在數秒內獲得完整引用的指引,取代先前需要數小時、數天或數週的手動流程。

受規範領域的 RAG 架構

Blue J 採用檢索增強生成(RAG)系統,將 GPT-4.1 與包含數百萬精選文件的專有資料庫結合。此資料庫收錄了權威的原始來源以及來自 Tax Notes 等供應商的專家評論。

當使用者提交查詢時,系統會檢索相關的來源資料,並使用 GPT-4.1 將資訊合成為清晰且具引用的答案。根據 CTO Brett Janssen 的說法,選擇 GPT-4.1 是因為它能持續遵循指示、尊重上下文,且在處理邊緣案例方面比其他測試過的模型更為有效。

反饋迴路與精準度擴展

為了在高風險環境中維持信任——錯誤可能導致審計或財務損失——Blue J 實施了閉環反饋系統:

  • 使用者驅動的回饋: 每個回應都包含一個「不同意」按鈕。當使用者標記回應時,系統會依問題類型、稅務主題與根本原因系統性分類。
  • AI 驅動的分流: 使用 GPT-4.1 分析數千個回饋點並將相關問題聚類,讓產品與稅務研究團隊能優先處理修正。
  • 快速迭代: 這種飛輪式方法已將不同意率降低至每 700 個回應中不足 1 個。

此基礎設施使 Blue J 能快速回應立法變更。例如,當 2025 年美國通過一項重大稅法時,團隊在法案簽署前的六週內繪製影響圖,並在數小時內將更新的答案部署至生產環境。

評估框架與模型選擇

Blue J 採用嚴謹的評估流程,以確保模型品質成為部署的門檻。公司使用包含超過 350 個提示的基準套件,涵蓋美國、加拿大與英國稅法,測試以下項目:

  1. 指示遵循度
  2. 來源對齊
  3. 答案清晰度

Brett Janssen 表示,OpenAI 的模型在這些內部基準測試中持續優於競爭對手,尤其在指示遵循與實務效用方面表現突出,因而使 Blue J 僅採用 OpenAI 模型。

商業影響與使用者參與

透過自動化檢索與合成稅法,Blue J 已將稅務專業人員的工作負荷轉向更高利潤的規劃與諮詢工作。關鍵績效指標包括:

  • 使用者留存率: 超過 70% 的使用者每週登入。
  • 效率提升: 使用者平均每週節省 2.7 小時於研究與客戶溝通。

Sources