Blue J가 GPT-4.1을 활용한 세무 연구 확장

Blue J는 GPT-4.1과 Retrieval-Augmented Generation(RAG)을 사용하여 복잡한 규정을 전문가 수준의 답변으로 자동 합성하는 세무 연구 엔진을 개발했습니다. 이 시스템을 통해 세무 전문가들은 몇 초 만에 완전한 인용이 포함된 안내를 받을 수 있게 되었으며, 이전에 몇 시간, 며칠, 혹은 몇 주가 걸리던 수작업 과정을 대체합니다.

규제 분야를 위한 RAG 아키텍처

Blue J는 GPT-4.1과 수백만 개의 선별된 문서로 구성된 독점 라이브러리를 결합한 Retrieval-Augmented Generation(RAG) 시스템을 활용합니다. 이 라이브러리에는 Tax Notes와 같은 제공업체의 권위 있는 1차 자료와 전문가 논평이 포함됩니다.

사용자가 질의를 제출하면 시스템은 관련 소스 자료를 검색하고 GPT-4.1을 사용해 정보를 명확하고 인용된 답변으로 합성합니다. CTO Brett Janssen에 따르면, GPT-4.1은 일관되게 지침을 따르고, 컨텍스트를 존중하며, 테스트된 다른 모델보다 엣지 케이스를 더 효과적으로 처리한다는 이유로 선택되었습니다.

피드백 루프와 정확도 확장

오류가 감사나 재정 손실로 이어질 수 있는 고위험 환경에서 신뢰를 유지하기 위해 Blue J는 폐쇄형 피드백 시스템을 구현했습니다:

  • 사용자 기반 피드백: 모든 응답에 "disagree" 버튼이 포함됩니다. 사용자가 응답을 표시하면 문제 유형, 세무 주제, 근본 원인별로 체계적으로 분류됩니다.
  • AI 기반 분류: GPT-4.1을 사용해 수천 개의 피드백 포인트를 분석하고 관련 이슈를 클러스터링함으로써 제품 및 세무 연구 팀이 수정 작업을 우선순위화할 수 있습니다.
  • 빠른 반복: 이 플라이휠 접근 방식으로 이의 제기 비율이 700회 응답당 1회 미만으로 감소했습니다.

이 인프라스트럭처를 통해 Blue J는 입법 변화에 신속히 대응할 수 있습니다. 예를 들어, 2025년에 주요 미국 세법이 통과되었을 때, 팀은 법안 서명 6주 전까지 영향을 매핑하고 몇 시간 안에 업데이트된 답변을 프로덕션에 배포했습니다.

평가 프레임워크 및 모델 선택

Blue J는 모델 품질이 배포의 관문 역할을 하도록 보장하기 위해 엄격한 평가 프로세스를 적용합니다. 회사는 미국, 캐나다, 영국 세법을 포괄하는 350개 이상의 프롬프트로 구성된 벤치마크 스위트를 사용해 다음 항목을 테스트합니다:

  1. 지침 준수
  2. 출처 정합성
  3. 답변 명료성

Brett Janssen은 OpenAI 모델이 이러한 내부 벤치마크에서 경쟁 모델보다 지속적으로 우수했으며, 특히 지침 이행 및 실제 활용도에서 뛰어나기 때문에 Blue J가 OpenAI 모델만을 독점적으로 제공하게 되었다고 밝혔습니다.

비즈니스 영향 및 사용자 참여

세법의 검색 및 합성을 자동화함으로써 Blue J는 세무 전문가들의 업무를 고부가가치인 기획 및 자문 업무로 전환했습니다. 주요 성과 지표는 다음과 같습니다:

  • 사용자 유지율: 70% 이상 사용자가 주간으로 로그인합니다.
  • 효율성 향상: 사용자는 연구 및 고객 커뮤니케이션에 주당 평균 2.7시간을 절감합니다.

Sources