QwenAudio/qwen-audio-agent

A realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents

Qwen Audio Agent – 实时语音优先 AI 助手

是什么 – 一个基于 Node.js 的运行时,支持与 AI 代理(例如 Qwen 3.5-Omni、Qwen Audio)进行全双工、低延迟语音交互。在您持续对话的同时,代理可启动后台任务(代码生成、文件编辑、网络搜索等),并将进度实时反馈回同一语音聊天中。该系统可作为命令行网关、Web UI、终端 TUI,或 macOS/Windows/Linux 上的浮动桌面“球体”使用。

核心功能

  • 全双工实时语音 – 可以边说话边打断,无需等待对方回应即可听到助手的回复。
  • 实时模型目录 – 从共享目录中选择 DashScope Qwen Audio 或 Qwen 3.5-Omni 实时模型。
  • 后端代理集成 – 通过 ACP 架构接入以代码为导向的代理(Qwen Code、OpenCode、Kimi Code、DeepSeek 等);前端也可在无后端的 仅前端模式 下运行。
  • 并行任务处理 – 可启动多个独立任务,实时查看进度卡片,随时询问状态或取消任务。结果会自动语音播报给您。
  • 跨平台 UI – 支持 Web UI、终端 TUI,以及带有自定义皮肤和宠物动画的桌面浮动球体。
  • 个性化与记忆 – 支持用户级长期偏好设置,以及跨会话持久化的本地记忆文件。
  • 可扩展网关 – 一键安装“技能”、工具适配器和自定义语音前端(包括完全本地的语音到语音转换栈)。

快速上手

  1. 使用 npm 全局安装(需 Node 22.22.2+):
    npm install -g qwen-audio-agent
    
  2. 运行配置向导以保存您的 DashScope API 密钥并选择实时模型:
    qwenaudio config
    
  3. 启动网关(中介语音与后端代理的本地服务器)和 UI:
    qwenaudio          # 启动网关
    qwenaudio tui      # 打开终端 UI(或 `qwenaudio webui` 启动浏览器版)
    
    在 macOS/Windows/Linux 上,您还可以通过 npm run desktop 启动桌面球体,或从发布页面下载预构建安装包。

典型使用场景

  • 桌面生产力 – 在代理编写代码、编辑文件或运行长时间构建时与之对话;可询问“编译进行到哪了?”,并获得语音反馈。
  • 智能驾驶舱 – 语音控制车辆导航、音乐、天气和快速购买流程(示例位于 examples/car)。
  • 客服机器人 – 在自然对话中,代理可在后台查询订单或创建工单。
  • 具身代理与直播助手 – 结合语音聊天与物理动作或直播互动,支持暂停、恢复或取消任务。

架构概览

  • 前端(语音) – 捕获麦克风音频,运行 VAD,将音频/文本发送至实时模型(DashScope 或本地语音到语音)。
  • 网关 – 中心 Node 进程,负责消息路由、任务生命周期管理及用户级记忆维护。
  • 后端代理 – 可选的 ACP 兼容代理,执行推理、工具调用或代码生成。网关可并行运行多个代理。

可扩展性

  • 通过内置技能管理器添加新 技能(工具适配器)。
  • 切换至完全本地的语音到语音转换栈(无需云密钥)。
  • 创建自定义桌面皮肤或宠物动画,响应运行时状态。

社区与支持

  • GitHub Issues 用于报告 Bug 和功能请求。
  • WeChat 群组(仓库内 QR 码)用于中文社区交流。
  • 详细文档:用户指南、快速入门、架构深度解析、隐私声明。

许可证 – Apache 2.0。


以上所有信息均直接取自仓库的 README,未添加任何外部假设。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目