How Tolan Builds Voice-First AI with GPT-5.1

Tolan은 Portola에서 개발한 음성‑우선 AI 동반자로, 개방형 장기 대화를 위해 설계되었습니다. GPT-5.1과 컨텍스트·메모리를 위한 특수 아키텍처를 활용해 자연스럽고 구불구불한 대화에 필요한 낮은 지연 시간과 일관된 개성을 구현합니다.

GPT-5.1이 향상시킨 제어성 및 지연 시간

GPT-5.1은 Tolan의 캐릭터‑주도 경험을 가능하게 하는 제어성 및 지연 시간 측면의 핵심 기술 향상을 제공합니다. Responses API와 결합된 GPT-5.1 전환으로 음성 시작 시간이 0.7초 이상 단축돼 대화 흐름이 크게 개선되었습니다.

속도뿐 아니라 GPT-5.1은 복합적이고 다층적인 프롬프트 지시(톤 스캐폴드, 메모리 주입, 캐릭터 특성 등)를 따르는 모델의 능력을 향상시켜 장시간 상호작용 시 드리프트를 크게 줄였습니다. Portola CEO인 Quinten Farmer는 “GPT-5.1 덕분에 우리가 구상한 캐릭터들을 마침내 표현할 수 있는 제어성을 얻었습니다.”라고 말했습니다.

실시간 컨텍스트 재구성

사용자가 대화 중간에 주제를 자주 바꾸는 음성 대화의 변동성을 처리하기 위해 Tolan은 여러 턴에 걸쳐 프롬프트를 캐시하지 않습니다. 대신 시스템은 매 턴마다 컨텍스트 윈도우를 처음부터 재구성합니다. 각 재구성에는 다음이 포함됩니다:

  • 최근 메시지 요약
  • 퍼소나 카드
  • 벡터 검색된 메모리
  • 톤 가이드
  • 실시간 앱 신호

이 접근 방식은 AI가 갑작스러운 주제 전환에 즉시 적응하도록 하여, 큰 규모의 불안정한 프롬프트에 의존하지 않고도 에이전트가 기반을 유지하도록 합니다.

메모리 아키텍처와 퍼소나 관리

Tolan은 모듈형 메모리 시스템을 사용해 시간에 걸친 일관성을 유지하며, 사실뿐 아니라 감정적 “바이브” 신호도 저장합니다.

메모리 기술 구현

  • 임베딩 및 저장: 메모리는 text-embedding-3-large 모델로 임베딩되어 고속 벡터 데이터베이스인 Turbopuffer에 저장되며, 50ms 미만의 조회 시간을 제공합니다.
  • 검색: 메모리 회수는 사용자의 최신 메시지와 시스템이 생성한 질문에 의해 트리거됩니다.
  • 유지보수: 야간 압축 작업이 중복되거나 가치가 낮은 항목을 제거하고 모순을 해결해 메모리 품질을 유지합니다.

퍼소나 및 감정 튜닝

각 AI 캐릭터는 과학 소설 작가가 만든 캐릭터 스캐폴드에 기반하고 행동 연구자가 다듬은 것입니다. 병행 시스템이 대화의 감정적 톤을 모니터링해 사용자 신호에 따라 장난스러운 톤과 차분한 톤 사이를 동적으로 조정하면서 핵심 퍼소나는 유지합니다.

성능 지표 및 사용자 영향

2025년 2월 출시 이후 Tolan은 월간 활성 사용자 200,000명 이상과 App Store 평점 4.8점을 달성했습니다. GPT-5.1 기반 퍼소나 도입으로 사용자 경험에 측정 가능한 개선이 나타났습니다:

  • 메모리 회수 실패: 제품 내 불만 신호를 통해 30% 감소.
  • 다음 날 사용자 유지율: 20% 이상 증가.

음성 AI 개발을 위한 핵심 원칙

Portola는 자연스러운 음성 에이전트를 구축하기 위한 네 가지 핵심 원칙을 제시합니다:

  1. 대화 변동성에 맞게 설계: 시스템은 음성 대화가 문장 중간에 전환될 때 빠르게 피벗해야 합니다.
  2. 지연 시간을 제품 경험의 일부로 간주: 서브 초 응답성이 기계적인 느낌을 피하는 데 필수적입니다.
  3. 메모리를 검색 시스템으로 구축: 고품질 압축과 빠른 벡터 검색이 거대한 컨텍스트 윈도우보다 효과적입니다.
  4. 매 턴마다 컨텍스트 재구성: 컨텍스트를 재생성하면 드리프트를 방지하고 구불구불한 대화 중에도 에이전트가 기반을 유지합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch