sou350121/VLA-Handbook

本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战

What it solves

VLA (Vision-Language-Action) 연구 논문을 읽는 것과 코드를 실제로 구현하는 것 사이의 격차를 메웁니다. 학술 논문에서 종종 생략되거나 부록·GitHub 이슈에 숨겨져 있는 엔트리 스크립트, 하이퍼파라미터, 하드웨어 선택 등 엔지니어링 세부 사항이 부족한 문제를 해결합니다.

How it works

이 프로젝트는 Pulsar 라는 자동 파이프라인으로 구동되는 살아있는 지식 베이스입니다. 시스템은 매일 새로운 VLA 논문을 스캔하고 평가하며 심층 분석을 생성합니다. 또한 중국의 小紅書(Xiaohongshu)와 영어권 HF Blog, Discord 커뮤니티, 그리고 상호작용이 활발한 GitHub 이슈에서 "현장 노트"를 자동으로 수집·요약하여 실제 배포 경험과 트러블슈팅 팁을 제공합니다.

Who it’s for

로봇공학 엔지니어, AI 연구자, 실제 하드웨어에서 VLA 모델을 배포·학습해야 하는 학생들을 위해 설계되었습니다.

Highlights

  • Engineering-First Content: 형태, 핵심 하이퍼파라미터, 엔트리 스크립트에 대한 sanity‑check를 제공해 코드가 실제로 동작하도록 보장합니다.
  • Community Distillation: 소셜 미디어와 개발자 포럼에서 실제 "함정"과 배포 팁을 집계합니다.
  • Automated Updates: 논문 트렌드, SOTA 벤치마크, 산업 뉴스(펀딩, IPO)를 추적하는 일일 파이프라인.
  • Comprehensive Scope: VLA 아키텍처, 액션 생성 패러다임(Diffusion, Flow Matching), Sim2Real 전환, 촉각/힘 정렬을 포괄합니다.
  • AI Integration: 핸드북 지식을 Cursor나 Claude Code와 같은 AI 코딩 어시스턴트에 직접 통합할 수 있는 "VLA Expert Skill"을 제공합니다.