sou350121/VLA-Handbook
本项目旨在为致力于进入VLA(Vision-Language-Action)领域的算法工程师提供一份全中文、实战导向的学习/面试手册。 不同于通用的 CV/NLP 面试指南,本项目聚焦于 Robotics 特有的挑战
VLA 手冊 – 視覺-語言-行動機器人學的活體知識庫
是什麼 – 一個持續更新的開源倉儲,匯集、整理並精煉快速成長的 VLA(視覺-語言-行動)文獻與工程經驗。它彌合了閱讀論文與在機器人上實際執行程式碼之間的差距,具備每日流水線,可取得新論文、評分並生成深度分析筆記。
為何重要 – VLA 研究(如 RT-1、RT-2、OpenVLA、π-0、Figure Helix)每週產出數十篇論文,但可重現性細節散落在 GitHub 問題、社群貼文與補充資料中。本手冊聚合這些資訊,添加健全性檢查腳本、超參數表格、形狀檢查與硬體建議,將混亂的文獻流轉化為可搜尋、版本控制的知識庫。
核心內容
- 525 篇理論文件:涵蓋核心 VLA 架構、擴散/流動行動表示、世界模型、觸覺感知及前沿主題。
- 165 篇英文與 300+ 篇中文社群筆記:從 Reddit/Discord、Hugging Face 博客、小紅書等平台採集,支援自動摘要與索引。
- 47 篇精煉的 GitHub 問題經驗(GPU 相容性、記憶體技巧、收斂失敗等)。
- 產業雷達 – 每日追蹤機器人/具身 AI 公司(融資、產品、IPO),並提供每周「產業判斷地圖」。
- RSS 訂閱源與 OPML:支援自動訂閱新理論筆記、每日訊號流、AI 代理新聞及週報。
- VLA 專家技能 – 一個插件,可將手冊知識注入 Claude Code、Cursor、Codex 或 OpenCode 等 AI 編碼助手。
- 自動化流水線(Pulsar) – 33 個 cron 任務,用於取得論文、評分(⚡/🔧/📖/❌)、執行健全性檢查腳本、更新倉儲,並自動調整 19 個領域假設的置信度。
如何使用
- 瀏覽
theory/檔案夾中的深度分析 Markdown 文件(如 VLA 架構總覽、Flow Matching 原理拆解)。每篇筆記包含入口腳本、關鍵超參數與形狀驗證片段。 - 部署 使用
deployment/README.md– 硬體選型指南、多模態同步檢查清單、Sim-2-Real 技巧,以及整合的「現實世界部署入口」。 - 保持更新 – 訂閱 RSS 訂閱源或 OPML 檔案;每日「PULSE」Markdown 顯示 15 個 VLA 方法族的流量、加速趨勢與 30 日趨勢。
- 利用 AI 技能 – 將
VLA-expert-skill檔案夾複製到你的 AI 編碼助手,即可在請求論文摘要、超參數建議或部署建議時即時取得手冊知識。 - 貢獻內容 – 開啟 issue 或 PR,新增論文分析、社群筆記或面試題庫(
question-bank/)。
誰會受益
- 需要可靠參考 VLA 模型內部結構與最新基準結果的 研究人員。
- 希望獲得可重現腳本、硬體相容性矩陣與 Sim-2-Real 排錯技巧的 工程師。
- 尋找精選面試題與具身 AI 公司產業情報的 學生與求職者。
- 希望獲得即用型 VLA 知識插件的 AI 助手開發者。
授權條款 – 創作共用署名 4.0(CC-BY-4.0)。可自由分享與改編,但需註明出處。
快速入門 – 克隆倉儲,閱讀 theory/README.md 了解學習路徑圖,然後依部署指南在機器人上執行 VLA 模型。RSS 訂閱源與 Pulsar 自動化預設運行,無需額外設定,除非你希望貢獻內容。
所有細節均直接來自倉儲的 README;未添加任何外部假設。
相關
- 專案
- 專案
- 專案
- 專案