Tolan 如何使用 GPT-5.1 建構語音優先 AI

Tolan,由 Portola 開發,是一個專為開放式、長期對話設計的語音優先 AI 伴侶。透過利用 GPT-5.1 和針對情境與記憶的專門架構,Tolan 實現了自然、漫談對話所需的低延遲與人格一致性。

GPT-5.1 提升可引導性與延遲

GPT-5.1 提供了關鍵的技術提升,在可引導性與延遲方面,使 Tolan 的角色驅動體驗成為可能。過渡到 GPT-5.1,結合 Responses API,使語音啟動時間減少超過 0.7 秒,顯著改善對話流暢度。

除了速度,GPT-5.1 還提升了模型遵循複雜、分層提示指令的能力——包括語調支架、記憶注入和角色特徵——在長時間互動中漂移遠少。根據 Portola 首席執行官 Quinten Farmer 的說法:「GPT-5.1 讓我們獲得了可引導性,終於能夠表達我們心中的角色。」

即時情境重建

為了處理語音對話的易變性——使用者經常在對話中途切換話題——Tolan 避免在多輪對話中快取提示。相反地,系統會在每輪從頭重建其情境窗口。每次重建包含:

  • 最近訊息的摘要
  • 人設卡
  • 向量檢索的記憶
  • 語調指引
  • 即時應用訊號

此方法使 AI 能夠即時適應突發的話題變化,確保代理人保持穩定,而無需依賴龐大且易碎的提示。

記憶架構與人格管理

Tolan 採用模組化記憶系統,以維持長時間的一致性,儲存不僅事實,還有情感「氛圍」訊號。

記憶的技術實作

  • Embedding and Storage: 記憶使用 text-embedding-3-large 模型進行嵌入,並存儲在 Turbopuffer,這是一個高速向量資料庫,可實現低於 50ms 的查詢時間。
  • Retrieval: 記憶回憶由使用者的最新訊息和系統合成的問題觸發。
  • Maintenance: 每晚的壓縮工作會移除冗餘或低價值的條目,並解決矛盾以維持記憶品質。

人格與情感調校

每個 AI 角色都基於由科幻小說作家撰寫、由行為研究者精煉的角色支架。一個平行系統會監控對話的情感基調,根據使用者線索動態調整語氣,在活潑或穩重之間切換,同時保持核心人格。

效能指標與使用者影響

自 2025 年 2 月推出以來,Tolan 已吸引超過 200,000 名月活躍用戶,並在 App Store 獲得 4.8 星評分。GPT-5.1 驅動的人格實施帶來了使用者體驗的可量測改進:

  • Memory recall misses: 記憶遺漏減少了 30%(透過產品內挫敗訊號測量)。
  • Next-day user retention: 次日用戶留存率提高了超過 20%。

語音 AI 開發的核心原則

基於他們的開發流程,Portola 識別出構建自然語音代理的四個關鍵原則:

  1. Design for conversational volatility: 系統必須能夠快速應對語音對話中句中轉變的易變性。
  2. Treat latency as part of the product experience: 次秒回應是產品體驗的重要組成部分,以避免機械感。
  3. Build memory as a retrieval system: 高品質壓縮與快速向量搜尋比龐大的情境窗口更有效。
  4. Rebuild context every turn: 每輪重建情境可防止漂移,讓代理在漫談對話中保持穩定。

Sources