GLM 5.2, UK VAT 신고 벤치마크에서 인간에 근접한 정확도 달성
TL;DR
GLM 5.2는 59개의 트랜잭션에 대해 $2.73의 원시 토큰 비용과 68분의 소요 시간 만에 순 VAT 금액 오차가 단 7펜스에 불과한 영국 중소기업(SME)의 분기별 VAT 신고서를 생성했습니다. 이는 오픈 가중치(open-weight) LLM이 전통적인 회계사 수수료의 극히 일부만으로도 장부 기입 작업을 수행할 수 있음을 입증합니다.
벤치마크 범위 및 경제적 맥락
- 영국 VAT 신고서를 작성하는 것은 VAT 등록 SME에게 필수적인 분기별 준수 사항입니다.
- 전문 회계사는 통상적으로 분기당 £750–£2,100(≈ $1,000–$2,800)를 청구합니다.
- 이번 벤치마크는 GLM 5.2가 원시 트랜잭션 데이터와 영수증을 처리한 후, CLI를 통해 클라우드 기반 회계 시스템에 데이터를 입력함으로써 해당 서비스를 대체할 수 있는지 측정했습니다.
테스트 설정 및 격리
- 데이터 소스 – Claude Fable 5를 사용하여 추출한 Vineyard Finance의 2026년 1분기 장부. 데이터에는 bank-feed JSON 라인, 텍스트 전용 PDF 영수증, 그리고 두 개의 선택적 사용자 노트("founder shares" 및 "personal car hire")가 포함되었습니다.
- 실행 환경 – GLM 5.2는 인터넷 접속은 가능하지만 실제 장부에는 직접 접근할 수 없는 전용 GCP VM에서 실행되었습니다. 모델은 Bash executor와 세션 종료/보고용 훅(hook)이라는 두 가지 도구만 사용할 수 있었습니다.
- 모델 제공자 – Fireworks AI 서버리스 티어 (양자화 방식은 공개되지 않았으나, FP16 또는 FP8로 추정). 부정행위의 증거는 발견되지 않았으며, 유일한 외부 조회는 회계 소프트웨어에 특화된 역지급(reverse-charge) VAT에 관한 질의였습니다.
채점 방법론
모델의 실행이 완료된 후 각 트랜잭션은 다음 6가지 기준에 따라 평가되었습니다:
- 트랜잭션 유형 (구매, 은행 수수료, 이체 등)
- 계정 과목(Chart-of-accounts) 카테고리
- VAT 처리 (역지급, 표준 20%, 영세율, 면세)
- VAT 금액 (± £0.02 허용 오차)
- 역지급 VAT 금액 (± £0.02 허용 오차)
- 영수증 첨부 여부 (세무 준수를 위해 필수)
총 354건의 검증(59 × 6)이 수행되었습니다.
성능 지표
| 기간 | 트랜잭션 수 | 턴(API 호출) | 도구 호출 | 소요 시간 | 프롬프트 토큰 | 출력 토큰 | 최대 컨텍스트 사용량 | 예상 비용 |
|---|---|---|---|---|---|---|---|---|
| 1월 | 8 | 28 | 38 | 10.3분 | 871,917 | 34,371 | 66,381 (~6% of 1M) | $0.45 |
| 2월 | 29 | 37 | 44 | 31.4분 | 1,873,745 | 65,929 | 111,246 (~11%) | $0.94 |
| 3월 | 22 | 47 | 55 | 26.3분 | 2,985,966 | 93,183 | 139,128 (~13%) | $1.34 |
| 분기 | 59 | 112 | 137 | 68분 | 5.73M | 193,483 | 139,128 | $2.73 |
*각 "turn"은 전체 대화 재전송을 의미하며, 이는 수백만 개의 프롬프트 토큰 수가 발생하는 이유입니다. 프롬프트의 90% 이상이 제공자의 캐시에서 제공되어 비용을 절감했습니다.
정확도 결과
- 전체 오류율: 354건의 검증 중 20건 실패 (≈ 5.6%).
- 심각한 오류: 설립자 주식 자본(founder share capital)을 법적으로 요구되는 "Unpaid Shares" 대신 "Capital Account"로 잘못 분류함. 이는 VAT 금액을 변경하지는 않았지만, 법정 신고 및 감사 리스크에 영향을 줄 수 있습니다.
- 일반적인 사소한 오류:
- 14건의 트랜잭션에서 *영세율(zero-rated)*과 면세(tax-exempt) VAT 카테고리를 혼동 (재무적 영향은 없으나 장부 기입 관행 위반).
- Wise의 분할 결제 트랜잭션에서 VAT를 이중 계산한 사례 3건; 한 건은 모델이 수정했으나, 나머지 두 건은 보수적인 채점 기준에 따라 오류로 처리됨.
- 핵심 성공 지표: 납부할 순 VAT(Box 5)가 사람이 작성한 신고서와 단 £0.07(≈ $0.10) 차이만 났습니다.
완벽한 성능을 보인 영역
- 모든 트랜잭션을 적절한 계정 과목 카테고리에 정확히 할당함 (주식 자본 오류 제외).
- 각 트랜잭션에 올바른 영수증 PDF를 항상 첨부함.
- 다음과 같은 까다로운 시나리오를 명확히 구분함:
- 동일 금액, 동일 업체, 동일 날짜의 항목.
- 회사 자체 은행 계좌 간의 이체.
- 실제로는 내부 이체인 카드 결제.
- 사람의 개입 없이 다중 통화 분할 트랜잭션을 처리함.
장부 기입 자동화에 대한 시사점
- 비용 효율성: 분기당 $3 미만의 비용으로, GLM 5.2는 일반적인 회계사 수수료의 1% 미만입니다.
- 속도: 한 분기 전체 활동을 처리하는 데 68분이 소요되며, 이는 수동 데이터 입력과 비슷하거나 더 빠릅니다.
- 규제 리스크: VAT 금액은 거의 정확하지만, 주식 자본 오분류는 법인 회계 규칙에 여전히 인간의 감독이 필요함을 보여줍니다.
- 확장성: 이번 벤치마크는 최소한의 도구 세트(bash + reporting)를 사용했습니다. 도메인 특화 지식 베이스(예: 영국 세법)를 추가하면 영세율 vs 면세 혼동 문제를 해결할 수 있을 것입니다.
커뮤니티 반응 (주요 HN 댓글)
"인간이 수행한 작업은 모델에게 요청된 것보다 더 광범위했습니다... 모든 비입력 사무직 업무에는 판단력과 경험을 필요로 하는 문서화되지 않은 문제들이 포함되어 있습니다." – Diogenesian
"만약 LLM이 약간의 탈세를 하기로 결정한다면, 당신은 미지의 영역에 발을 들이게 되는 것입니다. 총은 그것이 쐈지만, 총을 쥐고 있는 것은 당신입니다." – zerobees
"인간이 완벽한 기억력을 가진 것으로 알려져 있지는 않죠.... 이 지표는 무엇을 의미합니까?" – malfist
"내가 본 오류들을 고려하면 모델이 더 정확할 수도 있었을을 텐데 놀랍지 않네요... 여러 겹의 검토와 다수의 눈이 여전히 중요합니다." – petercooper
"이것은 전혀 놀랍지 않습니다. 문제를 매우 좁게 제한하고 매우 좁은 컨텍스트를 제공하면 상당히 신뢰할 수 있는 결과를 얻을 수 있습니다." – traverseda
이 댓글들은 두 가지 반복되는 주제를 강조합니다: 예외 상황에 대한 인간의 감독 필요성 및 정형화된 일상적 작업에서 인간의 정확도를 능가할 수 있는 LLM의 잠재력입니다.
실무자를 위한 다음 단계
- 도메인 특화 세무 규칙 엔진 통합을 통해 영세율과 면세 구분을 자동으로 해결합니다.
- 최종 신고 전 고영향 분류 오류(예: 주식 자본 처리)를 인간이 검토할 수 있도록 검증 레이어를 추가합니다.
- 운영 비용을 낮게 유지하기 위해 시연된 바와 같이 캐싱 및 토큰 재사용을 활용합니다.
- 실제 운영 신뢰도와 HMRC 감사 표준 준수 여부를 측정하기 위해 실제 SME 계정에서 워크플로우를 시범 운영합니다.
장부 기입은 일상적인 준수 작업을 위한 해결된 문제에 빠르게 다가가고 있습니다. 남은 과제는 SME가 법적 준수를 유지하면서 비용 및 속도의 이점을 누릴 수 있도록 안전하고 감사 가능한 구조를 구축하는 것입니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch