ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

LeRobot 仿真教程:4 步在虚拟世界跑通你的第一个抓取策略

LeRobot 仿真教程:4 步在虚拟世界跑通你的第一个抓取策略 LeRobot 仿真教程4 步在虚拟世界跑通你的第一个抓取策略【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobot假设你想验证一个抓取策略但手头只有一台笔记本——没有机械臂没有相机阵列更没有预算去买硬件。这时候打开 LeRobot 的仿真环境就是成本最低的选择它的虚拟世界按 gymnasium 标准接口封装了 Aloha 双臂、PushT 推块、LIBERO、MetaWorld 等一整套机器人任务数据、训练、评估都能在同一套命令行里完成。这篇文章就带你走一遍完整流程把环境跑起来、把数据跑起来、把策略跑起来、把评估跑起来最后聊聊怎么把成果迁移到真机。全程只需要几条命令跟着做就能上手。仿真就是机器人的驾驶模拟器先搞懂全链路为什么先仿真类比一下飞行员不会直接从实机起飞得先在驾驶模拟器里练。仿真环境的意义就在于此——策略在虚拟世界里反复撞车是免费的而每一次真机试错都可能换来维修账单。更重要的是仿真里录下的数据可以无限复用这是真机采集比不了的优势。LeRobot 的整条流水线可以概括为五个环节环境产生观测与奖励 → 数据被录成 LeRobotDataset 格式Parquet 存状态动作、MP4 存图像→ 策略在数据集上训练 → 同一个环境里评估成功率 → 最后才谈部署。数据够不够比算法更先决定上限。所以下面四个跑起来我们把数据环节放在第一位。 实操四连环境、数据、策略、评估依次跑起来第一步把环境跑起来LeRobot 支持从 PyPI 直接安装也可以装源码版并按需加装目标环境的扩展extras。以 PushT 推块任务为例git clone https://gitcode.com/GitHub_Trending/le/lerobot cd lerobot pip install -e .[pusht]pip install -e .装核心库.[pusht]这个 extras 会顺带装好 PushT 任务需要的依赖仓库同样提供aloha、libero、metaworld等 extras装哪个就打开哪个仿真世界。装完跑一下lerobot-info能正常输出设备与环境信息说明基础环境没装坏。想深入了解各环境的细节可以直接读仓库内的 LIBERO 环境文档。第二步把数据跑起来新手最容易卡住的一步没有真机数据从哪来两条路。第一条路直接用社区已有的数据集。LeRobot 的 LeRobotDataset 格式托管在 Hub 上像lerobot/aloha_mobile_cabinet这样的现成数据集一行参数就能加载进训练这是最省事的起点。第二条路自己录。仿真里遥操作录数据用的是仓库自带的lerobot-record命令配上遥操作设备gamepad 手柄遥操作在src/lerobot/teleoperators/gamepad/里就有实现真机录数据同理只是把遥操作设备换成你的手柄或主臂。录制时用--dataset.num_episodes指定条数——经验上录 50 条成功轨迹、每条 10~30 秒是大多数简单任务够用的起步量。第三步把策略跑起来训练被封装成一条命令指定策略类型和数据集剩下的批大小、学习率、评估频率等都有默认值需要调再加参数。lerobot-train \ --policy.typeact \ --dataset.repo_idlerobot/aloha_mobile_cabinet这条命令会用 ACT 策略在指定数据集上开训过程日志、损失曲线都会实时输出。跑完一轮后检查训练日志里的损失是否平稳下降就能进入评估。第四步把评估跑起来训练好不好最终要在环境里考试。LeRobot 用lerobot-eval统一了仿真评估入口加载一个训练好的策略指定环境类型跑 N 条 episode自动统计成功率。lerobot-eval \ --policy.pathlerobot/diffusion_pusht \ --env.typepusht \ --eval.n_episodes10以官方lerobot/diffusion_pusht为例这条命令会在 PushT 环境里跑 10 条评估轨迹并输出平均成功率。换成你自己训好的 checkpoint 路径就是你自己的考试成绩了。三种主流策略怎么选ACT、Diffusion、TDMPCLeRobot 内置的策略远不止三个Pi0、SmolVLA、GR00T 等 VLA 模型也都有但仿真实习圈最先接触的一般是模仿学习里的 ACT 与 Diffusion以及强化学习里的 TDMPC。横向对比一下维度ACTDiffusionTDMPC学习范式模仿学习模仿学习强化学习样本效率中等依赖演示数据质量中等鲁棒性强高可在环境中自己探索推理速度快适合实时控制中等推理比 ACT 慢较慢控制期需在线搜索适合场景有充足示教数据、要实时闭环动作分布多模态同一观察多种合理动作数据少、奖励函数可得上手难度低一条命令起步低配置项稍多中需要奖励设计与调参结论很简单手上有一堆示教轨迹就选 ACT 起步任务里同一个状态可以有多种合理做法比如绕障路径就试 Diffusion环境奖励函数明确、但示教数据稀少TDMPC 的样本效率才显出价值详见 TDMPC 策略文档。 从虚拟到真机部署前必须过的四道坎仿真里 90% 的成功率不代表真机也能 90%。中间的差距主要来自四个鸿沟LeRobot 社区应对它们的手段也相对固定鸿沟表现缓解手段动力学差异仿真摩擦、质量与真机不符域随机化在训练时随机扰动摩擦系数、质量等物理参数视觉差异仿真画面太干净视觉域适应对图像做风格迁移或色彩增强传感器噪声真机图像带噪点、标定偏移噪声注入训练数据里叠加高斯噪声执行延迟真机通信与控制有延迟延迟模拟给控制链路加入可控延迟项训练部署侧的动作就两个关键步骤一是模型导出把训练好的 checkpoint 转成目标设备能跑的格式二是接口适配真机侧由 LeRobot 统一的Robot类接管——SO-100、Koch、LeKiwi 这些机型都有现成实现你只需按机型改配置。换句话说仿真阶段训出来的策略落到真机上换的是外设不是大脑。收尾接下来往哪走回看这条链路仿真环境产生数据数据喂给策略策略在同一个环境里交卷最后靠域随机化等手段把成绩搬进现实。四个环节跑通之后你已经具备了独立迭代机器人策略的完整闭环。下一步建议三件事一是把 官方文档 过一遍尤其是数据集格式LeRobotDataset与处理器Processor两章二是加入项目社区Discord真机问题在论坛里基本都有人踩过坑三是往进阶方向选一条路走深——多智能体环境、HIL-SERL 人在环强化学习或 VLA 大模型微调都是 LeRobot 现在活跃的方向。【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表