QwenAudio/qwen-audio-agent
A realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents
Qwen Audio Agent – 實時語音優先 AI 助手
是什麼 – 一個基於 Node.js 的執行環境,支援與 AI 代理(例如 Qwen 3.5-Omni、Qwen Audio)進行全雙工、低延遲語音互動。在您持續對話的同時,代理可啟動背景任務(程式碼產生、檔案編輯、網路搜尋等),並將進度即時回饋至同一語音聊天中。此系統可作為指令列閘道、Web UI、終端 TUI,或 macOS/Windows/Linux 上的浮動桌面「球體」使用。
核心功能
- 全雙工即時語音 – 可邊說話邊打斷,無需等待對方回應即可聽到助手的回應。
- 即時模型目錄 – 從共享目錄中選擇 DashScope Qwen Audio 或 Qwen 3.5-Omni 即時模型。
- 後端代理整合 – 透過 ACP 架構接入以程式碼為導向的代理(Qwen Code、OpenCode、Kimi Code、DeepSeek 等);前端也可在無後端的 僅前端模式 下運行。
- 平行任務處理 – 可啟動多個獨立任務,即時查看進度卡片,隨時詢問狀態或取消任務。結果會自動語音回饋給您。
- 跨平台 UI – 支援 Web UI、終端 TUI,以及具備自訂皮膚與寵物動畫的桌面浮動球體。
- 個人化與記憶 – 支援使用者級長期偏好設定,以及跨會話持續的本地記憶檔案。
- 可擴展閘道 – 一鍵安裝「技能」、工具適配器和自訂語音前端(包括完全本地的語音到語音轉換堆疊)。
快速上手
- 使用 npm 全域安裝(需 Node 22.22.2+):
npm install -g qwen-audio-agent - 執行設定精靈以儲存您的 DashScope API 金鑰並選擇即時模型:
qwenaudio config - 啟動閘道(中介語音與後端代理的本機伺服器)和 UI:
在 macOS/Windows/Linux 上,您也可透過qwenaudio # 啟動閘道 qwenaudio tui # 開啟終端 UI(或 `qwenaudio webui` 啟動瀏覽器版)npm run desktop啟動桌面球體,或從發布頁面下載預建安裝檔。
典型使用情境
- 桌面生產力 – 在代理撰寫程式碼、編輯檔案或執行長時間建置時與之對話;可詢問「編譯進行到哪了?」,並獲得語音回饋。
- 智慧駕駛艙 – 語音控制車輛導航、音樂、天氣與快速購買流程(範例位於
examples/car)。 - 客服機器人 – 在自然對話中,代理可在背景查詢訂單或建立工單。
- 具身代理與直播助手 – 結合語音聊天與物理動作或直播互動,支援暫停、恢復或取消任務。
架構概覽
- 前端(語音) – 捕獲麥克風音訊,執行 VAD,將音訊/文字傳送至即時模型(DashScope 或本地語音到語音)。
- 閘道 – 中心 Node 進程,負責訊息路由、任務生命週期管理及使用者級記憶維護。
- 後端代理 – 可選的 ACP 相容代理,執行推理、工具使用或程式碼產生。閘道可並行運行多個代理。
可擴展性
- 透過內建技能管理器新增 技能(工具適配器)。
- 切換至完全本地的語音到語音轉換堆疊(無需雲端金鑰)。
- 建立自訂桌面皮膚或寵物動畫,回應執行時狀態。
社群與支援
- GitHub Issues 用於回報錯誤與功能請求。
- WeChat 群組(倉儲內 QR 碼)用於中文社群交流。
- 詳細文件:使用者指南、快速入門、架構深度解析、隱私權聲明。
授權 – Apache 2.0。
以上所有資訊均直接取自倉儲的 README,未添加任何外部假設。
相關
- 專案
- 專案
- 專案
- 專案
- 專案