kairos-agi/kairos
Official code for world model Kairos
해결하는 문제
Kairos는 수동적인 비디오 이해와 능동적인 로봇 제어 사이의 간극을 메우기 위해 설계된 4B 파라미터 네이티브 크로스 엔보디먼트 월드 모델입니다. 이 모델은 이질적인 엔보디먼트 데이터, 약한 장기 추론(long-horizon reasoning), 그리고 임보디드 AI의 에지 측 배포에 필요한 높은 컴퓨팅 요구 사항과 같은 과제를 해결합니다.
작동 원리
Kairos는 통합된 Mixture-of-Transformers 프레임워크를 사용하여 이해, 생성 및 동작 예측을 공동으로 처리합니다. 일반적인 비디오에서 인간의 행동 및 실제 로봇 상호작용 데이터로 점진적으로 이동하는 Cross-Embodiment Data Curriculum (CEDC)을 사용하여 학습됩니다. 효율적인 장기 모델링과 실시간 배포를 가능하게 하기 위해 Sliding-Window, Dilated Sliding-Window 및 Gated Linear Attention을 결합한 하이브리드 선형 시간 메모리 메커니즘을 채택합니다.
대상 사용자
다양한 하드웨어 플랫폼(Agibot G1, Unitree G1, Songling PIPER 등)에 걸쳐 일반화될 수 있고 실행 가능한 동작 궤적을 예측할 수 있는 모델이 필요한 임보디드 인텔리전스, 로보틱스 및 월드 모델 분야의 연구자와 개발자를 대상으로 합니다.
주요 특징
- 크로스 엔보디먼트 일반화: 단일 암, 이중 암 및 정교한 핸드 플랫폼 모두에서 작동하는 단일 모델.
- 월드-액션 모델: 시각적 관찰과 작업 컨텍스트로부터 실행 가능한 로봇 동작 궤적을 직접 예측합니다.
- 효율적인 에지 배포: 에지 측 GPU(예: RTX 5090, A800)에서 저지연, 고처리량 추론에 최적화되었습니다.
- 물리적 인과적 일관성: 인과적 Chain-of-Thought (CoT)를 사용하여 멀티모달 입력을 자율적 계획을 위한 심층 작업 로직으로 변환합니다.
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트