dnhkng/GLaDOS
This is the Personality Core for GLaDOS, the first steps towards a real-life implementation of the AI from the Portal series by Valve.
해결하는 문제
표준 LLM을 웨이크워드 없이 시각, 청각, 발화가 가능한 능동적인 다중 모달 AI 페르소나(포탈의 GLaDOS를 모델로)로 변환합니다. 반응적인 음성 보조자에서의 딱딱한 대화 문제를 저지연 파이프라인과 자율적인 '틱' 루프를 통해 해결하며, 환경 트리거에 따라 AI가 대화를 시작할 수 있도록 합니다.
작동 방식
미ン스키의 "마음의 사회"에 영감을 받은 다에이전트 아키텍처를 사용하며, 시각, 기억, 감정, 연구 등의 전문 하위 에이전트가 동적 컨텍스트에 기여합니다. 이후 메인 에이전트가 이 컨텍스트를 처리하여 응답을 생성합니다.
주요 기술 구성 요소:
- 입력 파이프라인: 음성 감지에 Silero VAD, 음성-텍스트 변환에 Parakeet ASR 사용.
- 시각: 장면 이해 및 변화 탐지에 FastVLM 사용.
- 자율성: 백그라운드 루프가 시간, 시각 이벤트, 또는 작업 업데이트에 따라 AI가 말하도록 트리거합니다.
- 성격: 반응적 기분에 PAD(쾌락-각성-지배) 모델과 안정적인 성격에 HEXACO 특성 결합.
- 도구: 홈 오토메이션 및 시스템 정보를 위한 Model Context Protocol (MCP) 통합.
- 출력: 저지연(600ms 미만)을 최적화한 커스텀 트레이닝된 TTS 모델(Kokoro) 사용.
대상 사용자
개성 있는 신체적 자율 AI 보조자를 구축하고 싶은 AI 애호가 및 아마추어 개발자, 저지연 음성/시각 파이프라인 및 다에이전트 오케스트레이션에 관심 있는 개발자.
주요 특징
- 능동적 상호작용: 웨이크워드 필요 없음. AI는 관찰하고 말할 것이 있으면 말함.
- 저지연: 자연스러운 흐름을 위해 응답 시간을 600ms 미만으로 최적화한 파이프라인.
- 다중 모달: 카메라(VLM)와 마이크(ASR) 통합으로 환경 인식 가능.
- 확장 가능한 도구: MCP 지원을 통해 시스템 상태 및 외부 홈 오토메이션에 연결 가능.
- 감정 엔진: PAD 모델 기반의 동적 기분 변화와 지속적인 성격 특성.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트