sou350121/VLA-Handbook

本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战

VLA 手册 – 视觉-语言-行动机器人学的活体知识库

是什么 – 一个持续更新的开源仓库,汇集、整理并提炼快速发展的 VLA(视觉-语言-行动)文献与工程经验。它弥合了阅读论文与在机器人上实际运行代码之间的差距,拥有每日流水线,可获取新论文、评分并生成深度分析笔记。

为何重要 – VLA 研究(如 RT-1、RT-2、OpenVLA、π-0、Figure Helix)每周产出数十篇论文,但可复现性细节散落在 GitHub 问题、社区帖子和补充材料中。本手册聚合这些信息,添加健全性检查脚本、超参数表格、形状检查和硬件建议,将混乱的文献流转化为可搜索、版本控制的知识库。

核心内容

  • 525 篇理论文档:涵盖核心 VLA 架构、扩散/流行动态表示、世界模型、触觉感知及前沿主题。
  • 165 篇英文和 300+ 篇中文社区笔记:从 Reddit/Discord、Hugging Face 博客、小红书等平台采集,支持自动摘要与索引。
  • 47 篇提炼的 GitHub 问题经验(GPU 兼容性、内存技巧、收敛失败等)。
  • 行业雷达 – 每日追踪机器人/具身 AI 公司(融资、产品、IPO),并提供每周“行业判断地图”。
  • RSS 订阅源与 OPML:支持自动订阅新理论笔记、每日信号流、AI 代理新闻及周报。
  • VLA 专家技能 – 一个插件,可将手册知识注入 Claude Code、Cursor、Codex 或 OpenCode 等 AI 编码助手。
  • 自动化流水线(Pulsar) – 33 个 cron 任务,用于获取论文、评分(⚡/🔧/📖/❌)、运行健全性检查脚本、更新仓库,并自动调整 19 个领域假设的置信度。

如何使用

  1. 浏览 theory/ 文件夹中的深度分析 Markdown 文档(如 VLA 架构总览Flow Matching 原理拆解)。每篇笔记包含入口脚本、关键超参数和形状验证片段。
  2. 部署 使用 deployment/README.md – 硬件选型指南、多模态同步检查清单、Sim-2-Real 技巧,以及整合的“现实世界部署入口”。
  3. 保持更新 – 订阅 RSS 订阅源或 OPML 文件;每日“PULSE” Markdown 显示 15 个 VLA 方法族的流量、加速趋势与 30 日趋势。
  4. 利用 AI 技能 – 将 VLA-expert-skill 文件夹复制到你的 AI 编码助手,即可在请求论文摘要、超参数建议或部署建议时即时获取手册知识。
  5. 贡献内容 – 开启 issue 或 PR,添加新论文分析、社区笔记或面试题库(question-bank/)。

谁会受益

  • 需要可靠参考 VLA 模型内部结构和最新基准结果的 研究人员
  • 希望获得可复现脚本、硬件兼容性矩阵和 Sim-2-Real 排错技巧的 工程师
  • 寻找精选面试题和具身 AI 公司行业情报的 学生与求职者
  • 希望获得即用型 VLA 知识插件的 AI 助手开发者

许可协议 – 创作共用署名 4.0(CC-BY-4.0)。可自由分享与改编,但需署名。

快速入门 – 克隆仓库,阅读 theory/README.md 了解学习路线图,然后按部署指南在机器人上运行 VLA 模型。RSS 订阅源与 Pulsar 自动化默认运行,无需额外配置,除非你希望贡献内容。


所有细节均直接来自仓库的 README;未添加任何外部假设。

相关

  • 项目
  • 项目
  • 项目
  • 项目