sou350121/VLA-Handbook
本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战
What it solves
它彌合了閱讀 VLA(Vision-Language-Action)研究論文與成功實作程式碼之間的鴻溝。它解決了工程細節的缺乏——例如入口腳本、超參數與硬體選擇——這些資訊常常在學術論文中被省略,或隱藏在附錄與 GitHub issue 中。
How it works
此專案作為一個活的知識庫,由名為 Pulsar 的自動化管線驅動。該系統每日掃描新發表的 VLA 論文,為其評分,並產生深入分析。它同時自動收集並濃縮來自中文(小紅書)與英文(HF Blog、Discord)社群,以及高互動的 GitHub issue 的「實地筆記」,提供真實的部署經驗與除錯技巧。
Who it’s for
此知識庫設計給機器人工程師、AI 研究者與需要在實體硬體上部署與訓練 VLA 模型的學生,提供實務、工程層級的指導。
Highlights
- Engineering-First Content:提供形狀、關鍵超參數與入口腳本的 sanity‑check,確保程式碼真的能跑。
- Community Distillation:彙整社群媒體與開發者論壇中的真實「坑」與部署技巧。
- Automated Updates:每日管線追蹤論文趨勢、SOTA 基準與產業新聞(資金、IPO)。
- Comprehensive Scope:涵蓋 VLA 架構、動作生成範式(Diffusion、Flow Matching)、Sim2Real 過渡,以及觸覺/力感對齊。
- AI Integration:提供「VLA Expert Skill」,可將手冊知識直接整合至 Cursor、Claude Code 等 AI 程式碼助理。