QwenAudio/qwen-audio-agent

A realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents

Qwen Audio Agent – 實時語音優先 AI 助手

是什麼 – 一個基於 Node.js 的執行環境,支援與 AI 代理(例如 Qwen 3.5-Omni、Qwen Audio)進行全雙工、低延遲語音互動。在您持續對話的同時,代理可啟動背景任務(程式碼產生、檔案編輯、網路搜尋等),並將進度即時回饋至同一語音聊天中。此系統可作為指令列閘道、Web UI、終端 TUI,或 macOS/Windows/Linux 上的浮動桌面「球體」使用。

核心功能

  • 全雙工即時語音 – 可邊說話邊打斷,無需等待對方回應即可聽到助手的回應。
  • 即時模型目錄 – 從共享目錄中選擇 DashScope Qwen Audio 或 Qwen 3.5-Omni 即時模型。
  • 後端代理整合 – 透過 ACP 架構接入以程式碼為導向的代理(Qwen Code、OpenCode、Kimi Code、DeepSeek 等);前端也可在無後端的 僅前端模式 下運行。
  • 平行任務處理 – 可啟動多個獨立任務,即時查看進度卡片,隨時詢問狀態或取消任務。結果會自動語音回饋給您。
  • 跨平台 UI – 支援 Web UI、終端 TUI,以及具備自訂皮膚與寵物動畫的桌面浮動球體。
  • 個人化與記憶 – 支援使用者級長期偏好設定,以及跨會話持續的本地記憶檔案。
  • 可擴展閘道 – 一鍵安裝「技能」、工具適配器和自訂語音前端(包括完全本地的語音到語音轉換堆疊)。

快速上手

  1. 使用 npm 全域安裝(需 Node 22.22.2+):
    npm install -g qwen-audio-agent
    
  2. 執行設定精靈以儲存您的 DashScope API 金鑰並選擇即時模型:
    qwenaudio config
    
  3. 啟動閘道(中介語音與後端代理的本機伺服器)和 UI:
    qwenaudio          # 啟動閘道
    qwenaudio tui      # 開啟終端 UI(或 `qwenaudio webui` 啟動瀏覽器版)
    
    在 macOS/Windows/Linux 上,您也可透過 npm run desktop 啟動桌面球體,或從發布頁面下載預建安裝檔。

典型使用情境

  • 桌面生產力 – 在代理撰寫程式碼、編輯檔案或執行長時間建置時與之對話;可詢問「編譯進行到哪了?」,並獲得語音回饋。
  • 智慧駕駛艙 – 語音控制車輛導航、音樂、天氣與快速購買流程(範例位於 examples/car)。
  • 客服機器人 – 在自然對話中,代理可在背景查詢訂單或建立工單。
  • 具身代理與直播助手 – 結合語音聊天與物理動作或直播互動,支援暫停、恢復或取消任務。

架構概覽

  • 前端(語音) – 捕獲麥克風音訊,執行 VAD,將音訊/文字傳送至即時模型(DashScope 或本地語音到語音)。
  • 閘道 – 中心 Node 進程,負責訊息路由、任務生命週期管理及使用者級記憶維護。
  • 後端代理 – 可選的 ACP 相容代理,執行推理、工具使用或程式碼產生。閘道可並行運行多個代理。

可擴展性

  • 透過內建技能管理器新增 技能(工具適配器)。
  • 切換至完全本地的語音到語音轉換堆疊(無需雲端金鑰)。
  • 建立自訂桌面皮膚或寵物動畫,回應執行時狀態。

社群與支援

  • GitHub Issues 用於回報錯誤與功能請求。
  • WeChat 群組(倉儲內 QR 碼)用於中文社群交流。
  • 詳細文件:使用者指南、快速入門、架構深度解析、隱私權聲明。

授權 – Apache 2.0。


以上所有資訊均直接取自倉儲的 README,未添加任何外部假設。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案