sou350121/VLA-Handbook
本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战
What it solves
它弥合了阅读 VLA(Vision-Language-Action)研究论文与成功实现代码之间的鸿沟。它解决了工程细节的缺乏——例如入口脚本、超参数与硬件选择——这些信息常常在学术论文中被省略,或隐藏在附录与 GitHub issue 中。
How it works
此项目作为一个活的知识库,由名为 Pulsar 的自动化管线驱动。该系统每日扫描新发表的 VLA 论文,为其评分,并产生深入分析。它同时自动收集并浓缩来自中文(小红书)与英文(HF Blog、Discord)社区,以及高互动的 GitHub issue 的「实地笔记」,提供真实的部署经验与排错技巧。
Who it’s for
此知识库设计给机器人工程师、AI 研究者与需要在实际硬件上部署与训练 VLA 模型的学生,提供实务、工程层面的指导。
Highlights
- Engineering-First Content:提供形状、关键超参数与入口脚本的 sanity‑check,确保代码真的能跑。
- Community Distillation:汇总社交媒体与开发者论坛中的真实「坑」与部署技巧。
- Automated Updates:每日管线追踪论文趋势、SOTA 基准与产业新闻(融资、IPO)。
- Comprehensive Scope:涵盖 VLA 架构、动作生成范式(Diffusion、Flow Matching)、Sim2Real 迁移,以及触觉/力感对齐。
- AI Integration:提供「VLA Expert Skill」,可将手册知识直接整合至 Cursor、Claude Code 等 AI 编码助理。