Intercom의 지속 가능한 AI 우위 전략

Intercom은 비즈니스를 재플랫폼화하기 위해 1억 달러를 투자하고 매달 수백만 건의 문의를 해결하는 AI 에이전트 Fin을 출시함으로써 생성형 AI를 고객 서비스 소프트웨어에 성공적으로 통합했습니다. 회사의 성공은 "AI‑first" 접근 방식으로의 전략적 전환에 기인하는데, 이는 제품 팀을 재구성하고 비‑AI 프로젝트를 취소하여 AI가 기능으로 추가되는 것이 아니라 제품의 핵심에 내재되도록 만든 것입니다.

초기 실험을 통한 모델 유창성 구축

Intercom은 모델의 한계와 기회를 깊이 이해하기 위해 모델을 일찍 그리고 자주 테스트함으로써 경쟁 우위를 유지합니다. 이러한 실전 접근 방식 덕분에 팀이 이미 GPT‑3.5의 역량을 파악하고 있었기 때문에 GPT‑4 출시 후 불과 4개월 만에 Fin을 출시할 수 있었습니다.

실험을 통해 얻은 주요 기술적 발견은 다음과 같습니다:

  • 작업별 모델 선택: Intercom은 처음에 복잡한 워크플로(예: 환불)를 자동화하는 "Fin Tasks"에 추론 모델 기반 스택을 계획했지만, 평가 결과 GPT‑4.1이 높은 신뢰도와 낮은 지연 시간으로 이러한 작업을 처리할 수 있음이 밝혀졌습니다.
  • 프롬프트 엔지니어링: 팀은 비추론 질의에 체인‑오브‑생각 프롬프트를 적용하면 성능 격차를 효과적으로 메울 수 있음을 발견했습니다.
  • 효율성 향상: Intercom의 평가에서 GPT‑4.1은 작업 완료 신뢰도가 가장 높으며, GPT‑4o 대비 비용을 20% 절감했습니다. 데이터 무결성을 보장하기 위해 완전성은 다섯 번의 독립 실행에서 모두 성공한 경우에만 Pass@k로 측정했습니다.

엄격한 평가로 배포 가속화

Intercom은 새로운 모델, 모달리티 및 아키텍처를 신속히 도입하기 위해 구조화된 평가 프로세스를 활용합니다. 이 프레임워크는 오프라인 테스트와 실시간 A/B 실험으로 구성되며, 배포 전 지시 수행, 도구 호출 정확도 및 일관성을 측정합니다.

평가 방법론

  • 벤치마킹: 모델은 실제 지원 상호작용 전사본에 대해 테스트되어 다단계 지시 수행, 브랜드 목소리 유지 및 함수 호출 실행 능력을 평가합니다.
  • A/B 테스트: 실시간 테스트는 GPT‑4와 GPT‑4.1 등 서로 다른 모델 간의 해결률 및 고객 만족도를 비교합니다.
  • 음성 전용 지표: Fin Voice(Realtime API 기반)에서는 인격, 톤, 중단 처리 및 배경 소음을 평가하여 인간 수준의 전화 지원을 보장합니다.

이러한 엄격한 프로세스를 통해 Intercom은 모델 출시 후 48시간 이내에 평가를 완료하고 며칠 만에 GPT‑4에서 GPT‑4.1으로 전환할 수 있었습니다.

아키텍처 유연성 유지

Intercom은 모듈식이며 모델에 구애받지 않는 아키텍처를 사용해 가장 적합한 모델로 질의를 라우팅하고 전체 시스템을 재설계하지 않고도 모델을 교체할 수 있습니다. 이 유연성은 채팅, 이메일, 음성 등 다양한 모달리티를 지원하는 데 필수적이며, 각각의 지연 시간 및 복잡도 요구사항이 다릅니다.

아키텍처 진화

  • 반복 설계: Fin의 아키텍처는 현재 세 번째 주요 반복 단계에 있으며, 네 번째 단계가 개발 중입니다. 이를 통해 팀은 모델이 개선될 때 복잡성을 추가하거나 단순화할 수 있습니다.
  • 복잡성 감소: GPT‑4.1의 뛰어난 지시 수행 능력 덕분에 Intercom은 Fin Tasks의 아키텍처를 보다 단순한 형태로 전환하여 복잡한 추론 기반 스택을 제거하고 전체 지연 시간과 비용을 낮출 수 있었습니다.

비즈니스 전반에 AI 역량 확대

모듈식 아키텍처와 고급 모델을 결합함으로써 Intercom은 기본 고객 지원을 넘어 비즈니스 전반의 워크플로에 AI 활용을 확대하고 있습니다:

  • 지원 팀: Fin AI 에이전트를 사용해 음성, 이메일, 채팅을 통한 대부분의 인바운드 문의를 해결합니다.
  • 운영 팀: Fin Tasks를 활용해 구독 업데이트, 계정 변경 및 환불을 자동화합니다.
  • 제품 팀: MCP 서버를 통해 ChatGPT와 같은 AI 도구가 티켓, 사용자 데이터 및 대화를 접근하도록 하여 제품 로드맵을 정교화하고 버그를 식별합니다.

Sources