dnhkng/GLaDOS

This is the Personality Core for GLaDOS, the first steps towards a real-life implementation of the AI from the Portal series by Valve.

解决的问题

将标准LLM转变为无需唤醒词即可看见、听见并说话的主动式多模态AI人格(以《传送门》中的GLaDOS为模型)。通过实现低延迟管道和自主的「tick」循环,解决了传统语音助手反应僵硬的问题,使AI能够基于环境触发主动发起对话。

工作原理

该项目采用受明斯基「心智社会」启发的多代理架构,由专门处理视觉、记忆、情感和研究的子代理共同构建动态上下文。主代理随后处理该上下文以生成响应。

关键技术组件包括:

  • 输入管道:使用Silero VAD进行语音检测,Parakeet ASR进行语音转文本。
  • 视觉:采用FastVLM进行场景理解与变化检测。
  • 自主性:后台循环根据时间、视觉事件或任务更新触发AI发言。
  • 人格:结合PAD(愉悦-唤醒-支配)模型实现动态情绪,HEXACO特质构建稳定人格。
  • 工具:集成Model Context Protocol (MCP) 用于家庭自动化与系统信息获取。
  • 输出:使用自定义训练的TTS模型(Kokoro),优化为低于600ms的往返延迟。

适用人群

希望构建具有鲜明个性的具身化、自主AI助手的AI爱好者和业余开发者,以及对低延迟语音/视觉管道和多代理编排感兴趣的开发者。

核心亮点

  • 主动交互:无需唤醒词;AI观察环境并在有话可说时主动发言。
  • 低延迟:优化的管道设计,确保响应时间低于600ms,实现自然流畅对话。
  • 多模态:集成摄像头(VLM)与麦克风(ASR),实现环境感知。
  • 可扩展工具:支持MCP,可连接系统状态与外部家庭自动化设备。
  • 情感引擎:基于PAD模型实现动态情绪变化,结合持久人格特质。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目