GPT-5.1を使ったTolanのVoice-First AIの構築方法

TolanはPortolaによって開発され、オープンエンドで長期的な対話のために設計された声優先のAIコンパニオンです。GPT-5.1とコンテキストおよびメモリのための専門的なアーキテクチャを活用することで、自然で彷徨う会話に必要な低遅延とパーソナリティの一貫性を達成します。

GPT-5.1が操縦性と遅延を向上

GPT-5.1は、Tolanのキャラクター駆動型体験を可能にする操縦性と遅延における重要な技術的進歩を提供します。GPT-5.1への移行とResponses APIの組み合わせにより、音声開始時間が0.7秒以上短縮され、会話の流れが大幅に改善されました。

速度だけでなく、GPT-5.1はトーンサcaffold、メモリ注入、キャラクター特性などの複雑で層状のプロンプト指示に従うモデルの能力を向上させ、長時間の相互作用においてドリフトを大幅に減らします。PortolaのCEOであるQuinten Farmerは次のように述べています。「GPT-5.1により、私たちが思い描いていたキャラクターを finally 表現する操縦性を得ることができました。」

リアルタイムコンテキスト再構成

ユーザーが会話中に頻繁に話題を変えるボイス会話の変動性に対処するため、Tolanは複数ターンにわたってプロンプトをキャッシュしません。代わりに、システムは毎ターン毎にコンテキストウィンドウをゼロから再構築します。各再構成には以下が含まれます:

  • 最近のメッセージのサマリー
  • ペルソナカード
  • ベクトル検索によるメモリ
  • トーンガイダンス
  • リアルタイムアプリシグナル

このアプローチにより、AIは急な話題変更に瞬時に適応し、大きくて脆弱なプロンプトに依存せずにエージェントを grounded に保つことができます。

メモリアーキテクチャとパーソナリティ管理

Tolanは時間の経過とともに一貫性を保つためにモジュラーなメモリシステムを採用し、事実だけでなく感情的な「vibe」シグナルも保存します。

メモリの技術的実装

  • 埋め込みとストレージ: メモリはtext-embedding-3-largeモデルを使用して埋め込まれ、サブ50msの検索時間を可能にする高速ベクトルデータベースであるTurbopufferに保存されます。
  • 検索: メモリの呼び出しは、ユーザーの最新メッセージとシステムが合成した質問によってトリガーされます。
  • メンテナンス: 毎晩の圧縮ジョブが冗長または低価値のエントリを削除し、矛盾を解決してメモリの品質を維持します。

パーソナリティと感情のチューニング

各AIキャラクターは、サイエンスフィクション作家によって作成されたキャラクタースキャフォールドに基づき、行動研究者によって洗練されています。並行システムが会話の感情的なトーンを監視し、ユーザーの cues に基づいて遊び心のあるトーンと落ち着いたトーンの間で配信を動的に調整しながら、コアなパーソナリティを維持します。

パフォーマンス指標とユーザーへの影響

2025年2月のリリース以来、Tolanは月間アクティブユーザーが20万人以上を達成し、App Storeで4.8星の評価を獲得しました。GPT-5.1を駆動するペルソナの実装により、ユーザー体験において測定可能な改善が見られました:

  • メモリ呼び出しミス: 製品内のフラストレーションシグナルを測定して30%減少。
  • 翌日ユーザー維持率: 20%以上増加。

Voice AI開発のためのコア原則

彼らの開発プロセスに基づき、Portolaは自然な声エージェントを構築するための4つの重要な原則を特定しています:

  1. 会話の変動性に対する設計: システムは音声会話が文中で変わるときに素早くピボットできる必要があります。
  2. 遅延を製品体験の一部として扱う: サブ秒応答性は機械的な感覚を避けるために不可欠です。
  3. メモリを検索システムとして構築: 高品質な圧縮と高速なベクトル検索は、 oversized コンテキストウィンドウよりも効果的です。
  4. 毎ターンコンテキストを再構築: コンテキストを再生成することでドリフトを防ぎ、彷徨う会話中にエージェントを grounded に保ちます。

Sources