Tolan 如何使用 GPT-5.1 建構語音優先 AI
Tolan,由 Portola 開發,是一個專為開放式、長期對話設計的語音優先 AI 伴侶。透過利用 GPT-5.1 和針對情境與記憶的專門架構,Tolan 實現了自然、漫談對話所需的低延遲與人格一致性。
GPT-5.1 提升可引導性與延遲
GPT-5.1 提供了關鍵的技術提升,在可引導性與延遲方面,使 Tolan 的角色驅動體驗成為可能。過渡到 GPT-5.1,結合 Responses API,使語音啟動時間減少超過 0.7 秒,顯著改善對話流暢度。
除了速度,GPT-5.1 還提升了模型遵循複雜、分層提示指令的能力——包括語調支架、記憶注入和角色特徵——在長時間互動中漂移遠少。根據 Portola 首席執行官 Quinten Farmer 的說法:「GPT-5.1 讓我們獲得了可引導性,終於能夠表達我們心中的角色。」
即時情境重建
為了處理語音對話的易變性——使用者經常在對話中途切換話題——Tolan 避免在多輪對話中快取提示。相反地,系統會在每輪從頭重建其情境窗口。每次重建包含:
- 最近訊息的摘要
- 人設卡
- 向量檢索的記憶
- 語調指引
- 即時應用訊號
此方法使 AI 能夠即時適應突發的話題變化,確保代理人保持穩定,而無需依賴龐大且易碎的提示。
記憶架構與人格管理
Tolan 採用模組化記憶系統,以維持長時間的一致性,儲存不僅事實,還有情感「氛圍」訊號。
記憶的技術實作
- Embedding and Storage: 記憶使用
text-embedding-3-large模型進行嵌入,並存儲在 Turbopuffer,這是一個高速向量資料庫,可實現低於 50ms 的查詢時間。 - Retrieval: 記憶回憶由使用者的最新訊息和系統合成的問題觸發。
- Maintenance: 每晚的壓縮工作會移除冗餘或低價值的條目,並解決矛盾以維持記憶品質。
人格與情感調校
每個 AI 角色都基於由科幻小說作家撰寫、由行為研究者精煉的角色支架。一個平行系統會監控對話的情感基調,根據使用者線索動態調整語氣,在活潑或穩重之間切換,同時保持核心人格。
效能指標與使用者影響
自 2025 年 2 月推出以來,Tolan 已吸引超過 200,000 名月活躍用戶,並在 App Store 獲得 4.8 星評分。GPT-5.1 驅動的人格實施帶來了使用者體驗的可量測改進:
- Memory recall misses: 記憶遺漏減少了 30%(透過產品內挫敗訊號測量)。
- Next-day user retention: 次日用戶留存率提高了超過 20%。
語音 AI 開發的核心原則
基於他們的開發流程,Portola 識別出構建自然語音代理的四個關鍵原則:
- Design for conversational volatility: 系統必須能夠快速應對語音對話中句中轉變的易變性。
- Treat latency as part of the product experience: 次秒回應是產品體驗的重要組成部分,以避免機械感。
- Build memory as a retrieval system: 高品質壓縮與快速向量搜尋比龐大的情境窗口更有效。
- Rebuild context every turn: 每輪重建情境可防止漂移,讓代理在漫談對話中保持穩定。