sou350121/VLA-Handbook

本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战

VLA Handbook – 시각-언어-행동 로보틱스를 위한 살아있는 지식 기반

무엇인가요 – 빠르게 성장하는 VLA(시각-언어-행동) 문헌과 엔지니어링 노하우를 수집하고 정리하는 지속적으로 업데이트되는 오픈소스 리포지토리입니다. 논문을 읽는 것과 실제로 로봇에서 코드를 실행하는 사이의 격차를 메우며, 매일 새로운 논문을 가져오고 평가하며 심층 분석 노트를 생성하는 파이프라인을 갖추고 있습니다.

왜 중요한가요 – RT-1, RT-2, OpenVLA, π-0, Figure Helix 등의 VLA 연구는 주당 수십 편의 논문을 발표하지만, 재현성 관련 정보는 GitHub 이슈, 커뮤니티 게시물, 보충 자료에 흩어져 있습니다. 이 핸드북은 이러한 정보를 통합하고, 건전성 검사 스크립트, 하이퍼파라미터 테이블, 형태 검사, 하드웨어 추천을 추가하여 혼란스러운 문헌 흐름을 검색 가능하고 버전 관리 가능한 지식 기반으로 전환합니다.

주요 콘텐츠

  • 525개의 이론 문서 – 핵심 VLA 아키텍처, 확산/플로우 행동 표현, 월드 모델, 촉각 인식, 최전방 주제를 포함.
  • 165개의 영문 및 300개 이상의 중국어 커뮤니티 노트 – Reddit/Discord, Hugging Face 블로그, Xiaohongshu에서 수집하여 자동 요약 및 인덱싱.
  • 47개의 요약된 GitHub 이슈 경험 (GPU 호환성, 메모리 기술, 수렴 실패 등).
  • 산업 레이더 – 로보틱스/임베디드 AI 기업의 일일 추적(자금 조달, 제품, IPO) 및 주간 "산업 판단 지도" 제공.
  • RSS 피드 및 OPML – 새로운 이론 노트, 일일 신호 피드, AI 에이전트 뉴스, 주간 보고서의 자동 구독 지원.
  • VLA 전문 스킬 – Claude Code, Cursor, Codex, OpenCode 등의 AI 코딩 보조 도구에 핸드북 지식을 주입하는 플러그인.
  • 자동화 파이프라인(Pulsar) – 33개의 cron 작업으로 논문을 가져오고 평가(⚡/🔧/📖/❌), 건전성 검사 스크립트 실행, 리포지토리 업데이트, 19개의 도메인 가설에 대한 신뢰도 자동 조정.

사용 방법

  1. 탐색theory/ 폴더에서 심층 마크다운 문서(예: VLA 아키텍처 개요, Flow Matching 원리 분해)를 확인하세요. 각 노트에는 진입점 스크립트, 주요 하이퍼파라미터, 형태 검증 스크립트가 포함되어 있습니다.
  2. 배포deployment/README.md를 사용하세요 – 하드웨어 선택 가이드, 멀티모달 동기화 체크리스트, Sim-2-Real 팁, 통합된 "현실 세계 배포 진입점" 제공.
  3. 업데이트 유지 – RSS 피드 또는 OPML 파일에 구독하세요. 매일 업데이트되는 "PULSE" 마크다운은 15개의 VLA 방법군에 대한 트래픽, 가속도, 30일간 추세를 표시합니다.
  4. AI 스킬 활용VLA-expert-skill 폴더를 AI 코딩 보조 도구에 복사하여 논문 요약, 하이퍼파라미터 추천, 배포 조언을 즉시 얻을 수 있습니다.
  5. 기여하기 – 새로운 논문 분석, 커뮤니티 노트, 인터뷰 질문은 question-bank/ 폴더에 추가하기 위해 이슈나 PR을 열어주세요.

누가 이득을 볼 수 있나요

  • VLA 모델 내부 구조와 최신 벤치마크 결과를 신뢰할 수 있는 참고자료로 필요로 하는 연구자.
  • 재현 가능한 스크립트, 하드웨어 호환성 매트릭스, Sim-2-Real 문제 해결 팁을 원하는 엔지니어.
  • 커리큘레이티드 인터뷰 질문과 임베디드 AI 기업에 대한 산업 인텔리전스를 찾는 학생 및 취업 준비생.
  • 즉시 사용 가능한 VLA 지식 플러그인을 원하는 AI 보조 도구 개발자.

라이선스 – Creative Commons Attribution 4.0 (CC-BY-4.0). 출처를 명시하면 콘텐츠를 공유 및 수정할 수 있습니다.

시작하기 – 리포지토리를 클론하고 theory/README.md를 읽어 학습 로드맵을 확인한 후, 배포 가이드를 따라 로봇에서 VLA 모델을 실행하세요. RSS 피드와 Pulsar 자동화는 자동으로 작동합니다. 기여하고 싶지 않은 경우 추가 설정은 필요 없습니다.


모든 세부 정보는 리포지토리의 README에서 직접 가져왔으며, 외부 가정은 추가되지 않았습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트