为 Skyrim 构建低延迟 AI 游戏伴侣

开发者 pantelisk 开发了 Varkos,这是一个智能游戏伴侣,旨在在 Skyrim 中与用户并肩作战。与主要关注对话的传统 AI NPC 框架不同,Varkos 专为高世界代理能力和低延迟而设计,允许伴侣根据自然语言命令在游戏世界中执行复杂的、多步骤的物理动作。

低延迟架构与性能

为了避免云端 LLM 实现中常见的破坏沉浸感的延迟,Varkos 使用了混合本地推理栈。该系统旨在玩家开始说话时立即开始处理,目标是在理想情况下实现低于 500ms 的总响应时间。

技术栈

  • 音频处理: 系统使用带有自定义内核的优化版 Qwen3-ASR 1.7b 模型。一个自定义框架通过滚动分片(40-80ms)处理音频,以支持流式语音转文本。
  • 语音活动检测 (VAD): 使用 Turnpipe 和 Silero 的优化版本来确定玩家何时完成说话或正在中断 AI。
  • 音频生成: Varkos 根据响应的复杂程度,采用 PocketTTS-Raven 进行快速生成(20-30ms)或采用 Qwen-3-TTS 进行更高程度的情感控制。
  • 硬件: 游戏在 Windows 上运行,而“大脑”和音频处理在 M4 MacBook 上运行(尽管作者指出它可以在 Windows 上完全运行,只需约 12GB 的专用 GPU RAM)。

延迟预算分解

组件 延迟
语音转文本 40-80ms
动作分析 20ms
响应生成与 Grounding 300-600ms
音频生成 20-60ms

通过 Action Latent Encoder (ALE) 实现世界代理能力

Varkos 的核心差异化在于 Action Latent Encoder (ALE),这是一个结合了嵌入、小型分类器、显式规则和传统机器学习的混合系统。ALE 允许 Varkos 将自然语言翻译成基于现实的(grounded)游戏动作,而无需完全依赖大型 LLM 进行每一个决策。

关键能力

  • 复杂命令分解: Varkos 可以处理多步骤指令。例如,一个“在这里等待,然后在箭矢信号后带回药水”的命令涉及注册一个未来触发器并监控游戏状态以寻找特定事件。

  • Grounded Item Search: Varkos 不会凭空捏造物品,而是搜索实际的游戏世界 JSON 状态来识别并检索特定对象。

  • 持续性目标: 像“捉迷藏”这样的活动被视为具有移动和完成条件的持续性计划,而不是单一的 API 调用。

  • 措辞不变性: ALE 旨在对措辞具有不变性;无论用户说“拿走那把剑”还是“该死的剑快拿过来”,系统都会将请求映射到相同的动作原型。

性格演化与“Void Mode”

虽然实时动作由本地处理,但 Varkos 使用云端 LLM 调用来进行缓慢的性格演化。这个过程是异步进行的,根据共享的经验来更新伴侣的特质和情感稳态。

动态角色成长

Varkos 最初是一个被转世为狗的、讽刺且自大的恶魔。随着时间的推移,共享的经验可以使他变得更加温顺和亲切,并根据玩家对待他的方式改变他的词汇和行为。

跨游戏持久性 (Void Mode)

Varkos 作为 Skyrim 之外的一个独立实体存在。当游戏关闭时,他进入“Void Mode”,此时他仍可以通过语音进行交流。这种架构允许伴侣有可能在不同的游戏之间跟随玩家,随着他们在转换过程中适应新的环境和规则。

社区洞察与技术讨论

Hacker News 上的社区成员强调了“可爱的小跟班”这一人格的情感共鸣,指出 AI 的偶尔失败感起来很自然,符合角色的性格。

"What's great is that the LLMisms fold neatly into 'dumb but lovable sidekick.' So even when it chokes or stumbles on a command, the kind of frustration the user expresses when correcting it feels natural and part of the game even."

其他技术讨论集中在通过专用 AI 硬件将这种方法集成到主机游戏中的潜力,或者使用未来能够边说话边异步分发工具的“Live”多模态模型来替换 ALE 的可能性。

Sources

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目