Tolan 如何使用 GPT-5.1 构建语音优先 AI

Tolan,由 Portola 开发,是一个专为开放式、长期对话设计的语音优先 AI 伴侣。通过利用 GPT-5.1 和专门用于上下文和记忆的架构,Tolan 实现了自然、漫谈对话所需的低延迟和人格一致性。

GPT-5.1 提升可控性和延迟

GPT-5.1 提供了在可控性和延迟方面的关键技术提升,使得 Tolan 的角色驱动体验成为可能。过渡到 GPT-5.1,结合 Responses API,使语音启动时间减少了超过 0.7 秒,显著改善了对话流程。

除了速度,GPT-5.1 还提升了模型遵循复杂、分层提示指令的能力——包括语调框架、记忆注入和角色特征——在长时间交互中漂移显著减少。据 Portola 首席执行官 Quinten Farmer 所说:“GPT-5.1 赋予了我们可控性,终于能够表达我们心中的角色。”

实时上下文重建

为了处理用户经常在对话中途切换话题的语音对话的易变性,Tolan 避免在多轮之间缓存提示。相反,系统会在每轮从头重建其上下文窗口。每次重建包含:

  • 最近消息的摘要
  • 人设卡
  • 向量检索到的记忆
  • 语调指导
  • 实时应用信号

这种方法使 AI 能够瞬间适应突如其来的话题变化,确保代理保持基础,而不依赖于大而脆弱的提示。

记忆架构与人格管理

Tolan 采用模块化记忆系统来随时间保持连贯性,不仅存储事实,还存储情感“氛围”信号。

记忆的技术实现

  • 嵌入和存储: 记忆使用 text-embedding-3-large 模型进行嵌入,并存储在 Turbopuffer 中,这是一个高速向量数据库,能够实现亚 50ms 的查询时间。
  • 检索: 记忆召回由用户的最新消息和系统合成的问题触发。
  • 维护: 每晚的压缩作业会删除冗余或低价值的条目并解决矛盾,以保持记忆质量。

人格与情感调节

每个 AI 角色都基于一位科幻作家编写的角色框架,并由行为研究者进行优化。一个并行系统监控对话的情感基调,根据用户线索动态调整输出,在活泼或基础的语调之间切换,同时保持核心人格。

性能指标与用户影响

自 2025 年 2 月推出以来,Tolan 已吸引超过 200,000 名月活跃用户,并在 App Store 获得 4.8 星评分。GPT-5.1 驱动的人格实现带来了用户体验的可衡量改进:

  • 记忆召回失误: 减少了 30%(通过产品内的挫败感信号测量)。
  • 次日用户留存: 提高了超过 20%。

语音 AI 开发的核心原则

基于他们的开发流程,Portola 提出了构建自然语音代理的四个关键原则:

  1. 针对对话易变性进行设计: 系统必须能够快速应对语音对话中途的转变。
  2. 将延迟视为产品体验的一部分: 次秒级响应对于避免机械感至关重要。
  3. 将记忆构建为检索系统: 高质量压缩和快速向量搜索比过大的上下文窗口更有效。
  4. 每轮重建上下文: 重新生成上下文可以防止漂移,并在漫谈对话中保持代理的基础。

Sources