Cherish's Notebook
切换到深色模式
菜单
返回项目列表

2025.11 – 2026.05 · 独立复现

LeRobot101:ACT / smolVLA / pi0.5 复现

  • LeRobot
  • ACT
  • smolVLA
  • pi0.5
  • 模仿学习
  • VLA
GitHub 仓库

项目简介

以 Hugging Face LeRobot 框架为主线,系统复现 ACT、smolVLA、pi0.5 三个代表性模型,覆盖模仿学习与视觉-语言-动作两大技术路线。项目打通了从遥操作数据采集、策略训练到仿真评估的完整链路,所有复现代码已整理上传至 GitHub。

复现内容

  • ACT(Action Chunking with Transformers):以动作分块预测替代单步动作回归,配合时间集成(temporal ensembling)平滑执行轨迹,复现数据采集、训练与仿真评估流程。
  • smolVLA:基于 SmolVLM 视觉-语言骨干的轻量 VLA 模型,在桌面操作任务上完成端到端复现,理解视觉观测与语言指令到动作 token 的映射方式。
  • pi0.5:基于 OpenPI 的预训练 VLA 策略,在自有任务配置上进行微调,验证「语言指令 → 视觉-语言理解 → 动作序列输出」的完整执行链路。

评估结果

在 Robosuite 中以脚本专家生成演示数据,训练行为克隆(BC)策略;在连续 20 轮评估中达到 80% 任务成功率,验证了数据质量与动作分块对策略稳定性的作用。