QwenAudio/qwen-audio-agent

A realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents

Qwen Audio Agent – 실시간 음성 우선 AI 어시스턴트

무엇인가요 – 저지연 양방향 음성으로 AI 에이전트(예: Qwen 3.5-Omni, Qwen Audio)와 대화할 수 있는 Node.js 기반 런타임입니다. 대화를 계속하는 동안 에이전트는 백그라운드 작업(코드 생성, 파일 편집, 웹 검색 등)을 수행하고 그 진행 상황을 동일한 음성 대화로 실시간으로 보고할 수 있습니다. 이 시스템은 명령줄 게이트웨이, 웹 UI, 터미널 TUI, 또는 macOS/Windows/Linux용 부유형 데스크톱 오브로 사용 가능합니다.

주요 기능

  • 양방향 실시간 음성 – 응답을 기다리지 않고 말하고, 중단하며, 어시스턴트의 음성을 들을 수 있습니다.
  • 실시간 모델 카탈로그 – 공유 카탈로그에서 DashScope Qwen Audio 또는 Qwen 3.5-Omni 실시간 모델을 선택할 수 있습니다.
  • 백엔드 에이전트 통합 – ACP 아키텍처를 통해 코드 중심 에이전트(Qwen Code, OpenCode, Kimi Code, DeepSeek 등)를 연결할 수 있습니다. 프론트엔드는 백엔드 없이도 프론트엔드 전용 모드로 실행 가능합니다.
  • 병렬 작업 처리 – 여러 독립된 작업을 동시에 시작하고, 실시간 진행 상황 카드를 확인하거나 상태를 묻거나 언제든지 취소할 수 있습니다. 결과는 자동으로 음성으로 다시 전달됩니다.
  • 크로스플랫폼 UI – 웹 UI, 터미널 TUI, 사용자 정의 스킨과 펫 애니메이션을 갖춘 데스크톱 부유형 오브.
  • 개인화 및 메모리 – 사용자별 장기적인 설정과 세션 간 유지되는 로컬 메모리 파일.
  • 확장 가능한 게이트웨이 – "스킬", 도구 어댑터, 커스텀 음성 프론트엔드(완전히 로컬 음성-음성 스택 포함)의 원클릭 설치.

시작 방법

  1. npm으로 전역 설치 (Node 22.22.2 이상 필요):
    npm install -g qwen-audio-agent
    
  2. 설정 마법사 실행하여 DashScope API 키를 저장하고 실시간 모델을 선택:
    qwenaudio config
    
  3. 게이트웨이(음성과 백엔드 에이전트를 중계하는 로컬 서버)와 UI 시작:
    qwenaudio          # 게이트웨이 시작
    qwenaudio tui      # 터미널 UI 열기 (또는 `qwenaudio webui`로 브라우저 버전)
    
    macOS/Windows/Linux에서는 npm run desktop으로 데스크톱 오브를 시작하거나, 릴리스 페이지에서 사전 빌드된 설치 프로그램을 다운로드할 수 있습니다.

일반적인 사용 사례

  • 데스크톱 생산성 – 코드 작성, 파일 편집, 긴 빌드 중에도 어시스턴트와 대화 가능. "컴파일은 어느 정도 진행되었나요?"라고 묻고 음성으로 업데이트를 받음.
  • 스마트 코크핏 – 차량 내비게이션, 음악, 날씨, 즉시 구매 흐름의 음성 제어(예시는 examples/car에 제공).
  • 고객 지원 봇 – 자연스러운 대화를 유지하면서 백엔드에서 주문 조회 또는 티켓 생성을 수행.
  • 신체화 에이전트 및 라이브스트리밍 어시스턴트 – 음성 대화와 물리적 동작 또는 라이브스트리밍 상호작용을 결합하고, 작업을 일시 중지, 재개, 취소할 수 있음.

아키텍처 개요

  • 프론트엔드(음성) – 마이크 음성 캡처, VAD 실행, 실시간 모델(DashScope 또는 로컬 음성-음성)로 음성/텍스트 전송.
  • 게이트웨이 – 메시지 라우팅, 작업 라이프사이클 관리, 사용자별 메모리 유지하는 중심 Node 프로세스.
  • 백엔드 에이전트 – 선택적 ACP 호환 에이전트로 추론, 도구 사용, 코드 생성 수행. 게이트웨이는 병렬로 여러 에이전트 실행 가능.

확장성

  • 내장 스킬 매니저를 통해 새로운 스킬(도구 어댑터) 추가.
  • 완전히 로컬 음성-음성 스택으로 음성 프론트엔드 교체(클라우드 키 필요 없음).
  • 런타임 상태에 반응하는 사용자 정의 데스크톱 스킨 또는 펫 애니메이션 생성.

커뮤니티 및 지원

  • 버그 및 기능 요청은 GitHub Issues.
  • 중국어 커뮤니티 채팅은 리포지토리 내 QR 코드로 참여 가능(WeChat 그룹).
  • 자세한 문서: 사용자 가이드, 빠른 시작, 아키텍처 심층 분석, 개인정보 보호 공지.

라이선스 – Apache 2.0.


위 모든 정보는 리포지토리의 README에서 직접 가져왔으며, 외부 가정은 전혀 추가하지 않았습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트