dnhkng/GLaDOS
This is the Personality Core for GLaDOS, the first steps towards a real-life implementation of the AI from the Portal series by Valve.
解决的问题
将标准LLM转变为无需唤醒词即可看见、听见并说话的主动式多模态AI人格(以《传送门》中的GLaDOS为模型)。通过实现低延迟管道和自主的「tick」循环,解决了传统语音助手反应僵硬的问题,使AI能够基于环境触发主动发起对话。
工作原理
该项目采用受明斯基「心智社会」启发的多代理架构,由专门处理视觉、记忆、情感和研究的子代理共同构建动态上下文。主代理随后处理该上下文以生成响应。
关键技术组件包括:
- 输入管道:使用Silero VAD进行语音检测,Parakeet ASR进行语音转文本。
- 视觉:采用FastVLM进行场景理解与变化检测。
- 自主性:后台循环根据时间、视觉事件或任务更新触发AI发言。
- 人格:结合PAD(愉悦-唤醒-支配)模型实现动态情绪,HEXACO特质构建稳定人格。
- 工具:集成Model Context Protocol (MCP) 用于家庭自动化与系统信息获取。
- 输出:使用自定义训练的TTS模型(Kokoro),优化为低于600ms的往返延迟。
适用人群
希望构建具有鲜明个性的具身化、自主AI助手的AI爱好者和业余开发者,以及对低延迟语音/视觉管道和多代理编排感兴趣的开发者。
核心亮点
- 主动交互:无需唤醒词;AI观察环境并在有话可说时主动发言。
- 低延迟:优化的管道设计,确保响应时间低于600ms,实现自然流畅对话。
- 多模态:集成摄像头(VLM)与麦克风(ASR),实现环境感知。
- 可扩展工具:支持MCP,可连接系统状态与外部家庭自动化设备。
- 情感引擎:基于PAD模型实现动态情绪变化,结合持久人格特质。
相关
- 项目
- 项目
huggingface/speech-to-speechSpeech‑to‑Speech is a Hugging Face open‑source pipeline that turns spoken input into spoken output. It chains VAD → STT → LLM → TTS, each component being swappable (Silero VAD, Parakeet/Faster‑Whisper/Whisper STT, any OpenAI‑compatible LLM or local Transformers/MLX model, Qwen3‑TTS or other TTS back‑ends). The whole system speaks the OpenAI Realtime protocol over WebSocket/WebRTC, so existing OpenAI Agents SDK code works. Install with a single `pip install speech-to-speech`, then run `speech-to-speech serve` (server) and `speech-to-speech talk` (client) or `speech-to-speech local` (both together). It supports local‑only operation, mixed local/hosted LLMs, Docker deployment, and optional extras for alternative TTS/STT models. Designed for voice‑assistant robots (e.g., Reachy Mini) and low‑latency spoken AI applications.
- 项目
- 项目
- 项目