google-research/language-table
Suite of human-collected datasets and a multi-task continuous control benchmark for open vocabulary visuolinguomotor learning.
解决的问题
它解决了创建能够实时理解并执行各种自然语言指令的机器人的挑战。具体而言,它旨在实现“开放词汇”视觉-语言-运动学习,允许机器人根据人类的语音执行复杂的、长程的重排任务(例如用积木拼出一个笑脸)。
工作原理
该项目提供了一个框架,将大规模的语言标注轨迹数据集与多任务连续控制基准测试相结合。通过在这些数据集上使用行为克隆(behavioral cloning)来训练策略——这些数据集包含了来自真实机器人和模拟环境的数十万个回合——从而将视觉输入和语言命令直接映射到运动技能。
适用对象
专为从事机器人技术、具身智能(embodied AI)以及计算机视觉与自然语言处理交叉领域研究的研究人员和开发人员设计。
亮点
- 海量数据集:包含近 600,000 条跨越真实世界和模拟环境的语言标注轨迹。
- 高度指令多样性:支持比以往工作多一个数量级的指令,在 87,000 个独特的自然语言字符串上报告了 93.5% 的成功率。
- 实时交互:使机器人能够通过实时语言接受人类引导以实现精确目标。
- 全面的资产:提供数据集、训练脚本、环境和预训练检查点。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch