LeRobot101:ACT / smolVLA / pi0.5 复现
GitHub 仓库项目简介
以 Hugging Face LeRobot 框架为主线,系统复现 ACT、smolVLA、pi0.5 三个代表性模型,覆盖模仿学习与视觉-语言-动作两大技术路线。项目打通了从遥操作数据采集、策略训练到仿真评估的完整链路,所有复现代码已整理上传至 GitHub。
复现内容
- ACT(Action Chunking with Transformers):以动作分块预测替代单步动作回归,配合时间集成(temporal ensembling)平滑执行轨迹,复现数据采集、训练与仿真评估流程。
- smolVLA:基于 SmolVLM 视觉-语言骨干的轻量 VLA 模型,在桌面操作任务上完成端到端复现,理解视觉观测与语言指令到动作 token 的映射方式。
- pi0.5:基于 OpenPI 的预训练 VLA 策略,在自有任务配置上进行微调,验证「语言指令 → 视觉-语言理解 → 动作序列输出」的完整执行链路。
评估结果
在 Robosuite 中以脚本专家生成演示数据,训练行为克隆(BC)策略;在连续 20 轮评估中达到 80% 任务成功率,验证了数据质量与动作分块对策略稳定性的作用。