Blue J 使用 GPT-4.1 扩大税务研究规模

Blue J 开发了一款税务研究引擎,使用 GPT-4.1 和检索增强生成(RAG)技术,将繁冗的法规自动合成为专家级答案。该系统使税务专业人士能够在几秒钟内获得完整引用的指导,取代了此前需要数小时、数天甚至数周的手动过程。

受监管领域的 RAG 架构

Blue J 使用检索增强生成(RAG)系统,将 GPT-4.1 与包含数百万精选文档的专有库相结合。该库包括权威的原始来源以及来自 Tax Notes 等提供商的专家评论。

当用户提交查询时,系统检索相关的源材料,并使用 GPT-4.1 将信息合成为清晰且带有引用的答案。根据首席技术官 Brett Janssen 的说法,选择 GPT-4.1 是因为它能够始终遵循指令、尊重上下文,并且比其他测试模型更有效地处理边缘案例。

反馈循环与准确性扩展

为了在错误可能导致审计或财务损失的高风险环境中保持信任,Blue J 实施了闭环反馈系统:

  • 用户驱动的反馈: 每个响应都包含一个“不同意”按钮。当用户标记响应时,会根据问题类型、税务主题和根本原因进行系统分类。
  • AI 驱动的分流: 使用 GPT-4.1 分析数千条反馈并对相关问题进行聚类,使产品和税务研究团队能够优先处理修复工作。
  • 快速迭代: 这种飞轮式方法将不同意率降低至每 700 条响应中不足 1 条。

该基础设施使 Blue J 能够快速响应立法变化。例如,当 2025 年一项重大美国税法法案通过时,团队在法案签署前的六周内绘制影响图,并在数小时内将更新的答案部署到生产环境。

评估框架与模型选择

Blue J 采用严格的评估流程,确保模型质量成为部署的门槛。公司使用包含 350 多个提示的基准套件,覆盖美国、加拿大和英国的税法,以测试以下方面:

  1. 指令遵循
  2. 来源对齐
  3. 答案清晰度

Brett Janssen 表示,OpenAI 模型在这些内部基准测试中始终优于竞争对手,尤其在指令遵循和实际效用方面表现突出,这促使 Blue J 仅使用 OpenAI 模型进行交付。

商业影响与用户参与

通过自动化税法的检索和合成,Blue J 已将税务专业人士的工作负荷转向更高利润的规划和咨询工作。关键绩效指标包括:

  • 用户留存率: 超过 70% 的用户每周登录。
  • 效率提升: 用户每周在研究和客户沟通上平均节省 2.7 小时。

Sources