为 Skyrim 构建低延迟 AI 游戏伴侣
开发者 pantelisk 开发了 Varkos,这是一个智能游戏伴侣,旨在在 Skyrim 中与用户并肩作战。与主要关注对话的传统 AI NPC 框架不同,Varkos 专为高世界代理能力和低延迟而设计,允许伴侣根据自然语言命令在游戏世界中执行复杂的、多步骤的物理动作。
低延迟架构与性能
为了避免云端 LLM 实现中常见的破坏沉浸感的延迟,Varkos 使用了混合本地推理栈。该系统旨在玩家开始说话时立即开始处理,目标是在理想情况下实现低于 500ms 的总响应时间。
技术栈
- 音频处理: 系统使用带有自定义内核的优化版 Qwen3-ASR 1.7b 模型。一个自定义框架通过滚动分片(40-80ms)处理音频,以支持流式语音转文本。
- 语音活动检测 (VAD): 使用 Turnpipe 和 Silero 的优化版本来确定玩家何时完成说话或正在中断 AI。
- 音频生成: Varkos 根据响应的复杂程度,采用 PocketTTS-Raven 进行快速生成(20-30ms)或采用 Qwen-3-TTS 进行更高程度的情感控制。
- 硬件: 游戏在 Windows 上运行,而“大脑”和音频处理在 M4 MacBook 上运行(尽管作者指出它可以在 Windows 上完全运行,只需约 12GB 的专用 GPU RAM)。
延迟预算分解
| 组件 | 延迟 |
|---|---|
| 语音转文本 | 40-80ms |
| 动作分析 | 20ms |
| 响应生成与 Grounding | 300-600ms |
| 音频生成 | 20-60ms |
通过 Action Latent Encoder (ALE) 实现世界代理能力
Varkos 的核心差异化在于 Action Latent Encoder (ALE),这是一个结合了嵌入、小型分类器、显式规则和传统机器学习的混合系统。ALE 允许 Varkos 将自然语言翻译成基于现实的(grounded)游戏动作,而无需完全依赖大型 LLM 进行每一个决策。
关键能力
复杂命令分解: Varkos 可以处理多步骤指令。例如,一个“在这里等待,然后在箭矢信号后带回药水”的命令涉及注册一个未来触发器并监控游戏状态以寻找特定事件。
Grounded Item Search: Varkos 不会凭空捏造物品,而是搜索实际的游戏世界 JSON 状态来识别并检索特定对象。
持续性目标: 像“捉迷藏”这样的活动被视为具有移动和完成条件的持续性计划,而不是单一的 API 调用。
措辞不变性: ALE 旨在对措辞具有不变性;无论用户说“拿走那把剑”还是“该死的剑快拿过来”,系统都会将请求映射到相同的动作原型。
性格演化与“Void Mode”
虽然实时动作由本地处理,但 Varkos 使用云端 LLM 调用来进行缓慢的性格演化。这个过程是异步进行的,根据共享的经验来更新伴侣的特质和情感稳态。
动态角色成长
Varkos 最初是一个被转世为狗的、讽刺且自大的恶魔。随着时间的推移,共享的经验可以使他变得更加温顺和亲切,并根据玩家对待他的方式改变他的词汇和行为。
跨游戏持久性 (Void Mode)
Varkos 作为 Skyrim 之外的一个独立实体存在。当游戏关闭时,他进入“Void Mode”,此时他仍可以通过语音进行交流。这种架构允许伴侣有可能在不同的游戏之间跟随玩家,随着他们在转换过程中适应新的环境和规则。
社区洞察与技术讨论
Hacker News 上的社区成员强调了“可爱的小跟班”这一人格的情感共鸣,指出 AI 的偶尔失败感起来很自然,符合角色的性格。
"What's great is that the LLMisms fold neatly into 'dumb but lovable sidekick.' So even when it chokes or stumbles on a command, the kind of frustration the user expresses when correcting it feels natural and part of the game even."
其他技术讨论集中在通过专用 AI 硬件将这种方法集成到主机游戏中的潜力,或者使用未来能够边说话边异步分发工具的“Live”多模态模型来替换 ALE 的可能性。
Sources
相关
- 项目
- 项目
- 项目
- 项目
- 项目