sou350121/VLA-Handbook
本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战
VLA 手册 – 视觉-语言-行动机器人学的活体知识库
是什么 – 一个持续更新的开源仓库,汇集、整理并提炼快速发展的 VLA(视觉-语言-行动)文献与工程经验。它弥合了阅读论文与在机器人上实际运行代码之间的差距,拥有每日流水线,可获取新论文、评分并生成深度分析笔记。
为何重要 – VLA 研究(如 RT-1、RT-2、OpenVLA、π-0、Figure Helix)每周产出数十篇论文,但可复现性细节散落在 GitHub 问题、社区帖子和补充材料中。本手册聚合这些信息,添加健全性检查脚本、超参数表格、形状检查和硬件建议,将混乱的文献流转化为可搜索、版本控制的知识库。
核心内容
- 525 篇理论文档:涵盖核心 VLA 架构、扩散/流行动态表示、世界模型、触觉感知及前沿主题。
- 165 篇英文和 300+ 篇中文社区笔记:从 Reddit/Discord、Hugging Face 博客、小红书等平台采集,支持自动摘要与索引。
- 47 篇提炼的 GitHub 问题经验(GPU 兼容性、内存技巧、收敛失败等)。
- 行业雷达 – 每日追踪机器人/具身 AI 公司(融资、产品、IPO),并提供每周“行业判断地图”。
- RSS 订阅源与 OPML:支持自动订阅新理论笔记、每日信号流、AI 代理新闻及周报。
- VLA 专家技能 – 一个插件,可将手册知识注入 Claude Code、Cursor、Codex 或 OpenCode 等 AI 编码助手。
- 自动化流水线(Pulsar) – 33 个 cron 任务,用于获取论文、评分(⚡/🔧/📖/❌)、运行健全性检查脚本、更新仓库,并自动调整 19 个领域假设的置信度。
如何使用
- 浏览
theory/文件夹中的深度分析 Markdown 文档(如 VLA 架构总览、Flow Matching 原理拆解)。每篇笔记包含入口脚本、关键超参数和形状验证片段。 - 部署 使用
deployment/README.md– 硬件选型指南、多模态同步检查清单、Sim-2-Real 技巧,以及整合的“现实世界部署入口”。 - 保持更新 – 订阅 RSS 订阅源或 OPML 文件;每日“PULSE” Markdown 显示 15 个 VLA 方法族的流量、加速趋势与 30 日趋势。
- 利用 AI 技能 – 将
VLA-expert-skill文件夹复制到你的 AI 编码助手,即可在请求论文摘要、超参数建议或部署建议时即时获取手册知识。 - 贡献内容 – 开启 issue 或 PR,添加新论文分析、社区笔记或面试题库(
question-bank/)。
谁会受益
- 需要可靠参考 VLA 模型内部结构和最新基准结果的 研究人员。
- 希望获得可复现脚本、硬件兼容性矩阵和 Sim-2-Real 排错技巧的 工程师。
- 寻找精选面试题和具身 AI 公司行业情报的 学生与求职者。
- 希望获得即用型 VLA 知识插件的 AI 助手开发者。
许可协议 – 创作共用署名 4.0(CC-BY-4.0)。可自由分享与改编,但需署名。
快速入门 – 克隆仓库,阅读 theory/README.md 了解学习路线图,然后按部署指南在机器人上运行 VLA 模型。RSS 订阅源与 Pulsar 自动化默认运行,无需额外配置,除非你希望贡献内容。
所有细节均直接来自仓库的 README;未添加任何外部假设。
相关
- 项目
- 项目
- 项目
- 项目