為 Skyrim 打造低延遲 AI 遊戲夥伴

開發者 pantelisk 開發了 Varkos,這是一款專為在 Skyrim 中與使用者並肩作戰而設計的智慧遊戲夥伴。與主要關注對話的傳統 AI NPC 架構不同,Varkos 旨在實現高世界代理權(world agency)與低延遲,讓夥伴能根據自然語言指令在遊戲世界中執行複雜的多步驟物理動作。

低延遲架構與效能

為了避免雲端 LLM 實作中常見的破壞沉浸感的延遲,Varkos 使用了混合式本地推論堆疊。該系統設計為在玩家開始說話時立即開始處理,目標是在最佳情況下實現低於 500ms 的總回應時間。

技術堆疊

  • 音訊處理: 系統使用經過優化的 Qwen3-ASR 1.7b 模型與自定義核心(kernels)。一個自定義框架會以滾動式片段(40-80ms)處理音訊,以支援串流語音轉文字。
  • 語音活動檢測 (VAD): 使用 Turnpipe 與 Silero 的優化版本來判斷玩家何時說完話或正在中斷 AI。
  • 音訊生成: Varkos 採用 PocketTTS-Raven 進行快速生成(20-30ms),並根據回應的複雜程度,使用 Qwen-3-TTS 以獲得更高的情感控制。
  • 硬體: 遊戲在 Windows 上執行,而「大腦」與音訊處理則在 M4 MacBook 上執行(不過作者提到,若有約 12GB 的專用 GPU RAM,也可以完全在 Windows 上執行)。

延遲預算分解

組件 延遲
語音轉文字 40-80ms
動作分析 20ms
回應生成與 Grounding 300-600ms
音訊生成 20-60ms

透過 Action Latent Encoder (ALE) 實現世界代理權

Varkos 的核心差異化在於 Action Latent Encoder (ALE),這是一個結合了嵌入(embeddings)、小型分類器、明確規則與傳統機器學習的混合系統。ALE 讓 Varkos 能將自然語言轉化為具備實體基礎的遊戲動作,而不必完全依賴大型 LLM 來做每一項決策。

關鍵能力

  • 複雜指令分解: Varkos 可以處理多步驟指令。例如,「在此等待,然後在箭矢信號後帶一瓶藥水過來」這類指令涉及註冊一個未來觸發器並監控遊戲狀態以尋找特定事件。
  • 具備實體基礎的物品搜尋: Varkos 不會憑空捏造物品,而是搜尋實際的遊戲世界 JSON 狀態來識別並檢索特定物件。
  • 持續性目標: 像「捉迷藏」這樣的活動被視為具有移動與完成條件的持續性計畫,而非單一的 API 呼叫。
  • 語句不變性: ALE 設計為對語句不具敏感性;無論使用者說「拿走那把劍」還是「去把那該死的劍拿過來」,系統都會將請求映射到相同的動作原型。

性格演化與「虛空模式」(Void Mode)

雖然即時動作是由本地處理,但 Varkos 使用雲端 LLM 呼叫來進行緩慢的性格演化。這個過程是異步進行的,根據共享的經驗來更新夥伴的特質與情感穩態(emotional homeostasis)。

動態角色成長

Varkos 最初是一個轉世為狗的、毒舌且自傲的惡魔。隨著時間推移,共同的經驗可以讓他變得更加馴化且充滿愛意,並根據玩家對他的對待方式來改變他的詞彙與行為。

跨遊戲持續性 (Void Mode)

Varkos 作為一個獨立實體存在於 Skyrim 之外。當遊戲關閉時,他會進入「虛空模式」(Void Mode),此時他仍可以透過語音進行溝通。

這項架構讓夥伴有可能跟隨玩家跨越不同的遊戲,隨著轉換過程適應新的環境與規則。

社群洞察與技術討論

Hacker News 的社群成員強調了「討人喜歡的副手」這一人格特質的情感共鳴,並指出 AI 的偶爾失敗感起來很自然,符合角色的性格。

"What's great is that the LLMisms fold neatly into 'dumb but lovable sidekick.' So even when it chokes or stumbles on a command, the kind of frustration the user expresses when correcting it feels natural and part of the game even."

其他技術討論則集中在這種方法如何透過專用 AI 硬體整合進主機遊戲,或是未來使用能在一邊說話時異步派遣工具的「即時」多模態模型來取代 ALE 的可能性。

Sources

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案