wee733/Arx_GROOT

finetune isaacros groot n1.7 for arxr5a arm manipulation

0

stars

3

commits

Python

primary language

Jul 27, 2026

updated

README

Isaac GR00T N1.7 + ARX-R5 入门工作区

当前服务器入口:请先阅读 服务器复现与 ARX 后续计划。无代理环境优先按 离线工件传输 搬运模型缓存。

这个工作区把 NVIDIA 当前的 GR00T N1.7 GA 教程固定成一套可重复执行的本机流程,并把后续 ARX-R5 接入所需的数据与控制接口单独定义出来。

当前服务器状态(2026-07-24)

已完成:

  • 服务器有 6 张 RTX PRO 6000 Blackwell Server Edition,每张约 96 GB VRAM;/data2 还有约 1.1 TiB,可承担完整微调。
  • 所有大型工件均配置在 /data2/buaalibozhao/gr00t-n1.7,避免写满只剩约 25 GB 的系统盘。
  • NVIDIA 官方仓库已固定到 N1.7 GA 提交 9c7e746b2cd37a810070a98ef41d290a07e806c2;5 组官方 demo 与 54 个 LFS 对象已通过完整性校验。
  • Python 3.12 / PyTorch 2.9 cu128 环境已创建;make verify-runtime 已通过核心 imports、CUDA 可见性、Blackwell capability 12.0 和官方 DROID AV1 抽帧解码。
  • 固定版 flash-attn wheel 已在服务器,SHA-256 与官方锁文件一致。
  • 固定 revision 的 nvidia/GR00T-N1.7-3B 与 gated nvidia/Cosmos-Reason2-2B cache 已完成 SHA-256、默认模型 ID 离线解析、 processor 解析和完整 31.44 亿参数 CPU 权重加载验证。
  • 无权重 ReplayPolicy server/client smoke 已通过。
  • ARX-R5 NEW_EMBODIMENT 的 6 轴手臂 + 1 维夹爪、front/wrist 双相机、raw-v1 转换、深度验证、统计、微调和开环入口已准备。

当前尚未执行 GPU 上的 DROID open-loop 和两步 ARX 微调 smoke;2026-07-24 复核时 6 张 GPU 均有其他用户的活跃训练任务,未抢占。服务器侧模型、数据和训练入口已经达到“收到合格数据即可开训”的状态;有明确空闲 GPU 后补跑这两项最终 smoke。

已验证参考基线(5090,2026-07-21)

以下结果来自原 5090 环境,不代表当前服务器已经重跑:

  • Isaac Sim 5.1.0、Isaac Lab 2.3.2、Isaac ROS 4.5/Jazzy 和 ARX cuMotion 工程已审计。
  • Franka Mimic 示例已回放;N1.7 DROID 开环已通过,参考平均 MSE 0.020047、MAE 0.076498、稳态约 0.2580 s/次
  • 当时 base 与 Cosmos 均已缓存,CUDA、flash-attn、torchcodec 和 DROID AV1 解码均通过。

完整历史结果见 N1.7 运行报告

最短运行路径

cd /home/buaalibozhao/Arx_GROOT
# 新 clone 才需要:cp .env.example .env,并把所有大目录设到 /data2

当前服务器按以下顺序收尾:

make preflight
make setup              # 幂等;完成/修复固定 Python 环境
make verify-runtime     # 已通过;环境或驱动变化后重跑
make verify-data
make verify-model-cache # 已通过;cache 或磁盘变化后重跑
make replay-smoke
make open-loop          # 需选择明确空闲的 GPU

在共享服务器上运行 open-loop 或微调前先检查 GPU 进程归属,不要占用其他用户的任务。

若要看策略服务接口:

# Terminal 1
make server

# Terminal 2
make client

应该怎样理解这几个 NVIDIA 组件

Isaac Sim / Isaac Lab       任务环境、示教采集、Mimic 数据扩增
            │
            ▼
GR00T LeRobot-v2 数据       RGB + state + action + language
            │
            ▼
GR00T N1.7                  从视觉/语言预测动作 chunk
            │
            ▼
ARX ROS adapter             关节顺序、单位、限位、watchdog、控制器调用
            │
            ├── Isaac Sim TopicBasedSystem(先验证)
            └── ARX 实机 ros2_control(安全门控后)

cuMotion / MoveIt           独立承担规划、IK、碰撞和约束,不会自动变成 GR00T embodiment

GR00T 不是 cuMotion 的替代品,也不会读取 MoveIt/XRDF 后自动理解 ARX。base checkpoint 的 XDOF tag 是三视角、双臂/双夹爪数据契约,不能把输出直接发送给单臂 ARX 实机。可靠路线是用 ARX 自己的示教数据微调 NEW_EMBODIMENT

推荐的学习顺序

  1. make open-loop:DROID 数据上的官方 N1.7 base 推理。
  2. SimplerEnv-Fractal:Google Robot 的官方 finetuned checkpoint 闭环仿真。
  3. make isaaclab-mimic-smoke:复用本机 Isaac Lab,理解示教、Mimic 扩增和 BC 数据链路。
  4. SO100 NEW_EMBODIMENT 与 ARX 两步训练 smoke:先验证自定义机械臂 loader/loss/checkpoint;模型 cache 到位后,当前 6×96 GB 服务器可承担正式微调。
  5. 给现有 ARX Isaac Sim 场景增加 front/wrist RGB、任务物体、reset 和成功判定。
  6. 采集 ARX 仿真/实机数据,离线验证后再接 PolicyServer;最后才做受控实机试验。

详细命令见:

目录

Isaac-GR00T/                 NVIDIA 官方源码,固定 GA commit,不在其中做 ARX 修改
configs/arx_r5/              ARX NEW_EMBODIMENT 模板
datasets/isaaclab_mimic/     NVIDIA/Isaac Lab 官方小型 Franka 数据
docs/                        教程、审计和接入说明
scripts/                     可重复执行的检查、安装、推理与验证脚本

运行 make help 可查看所有入口。

服务器完成 make verify-runtimemake verify-model-cache,再收到符合 ARX 6+1 双相机契约的数据后,可直接启动微调:

CUDA_VISIBLE_DEVICES=0 NUM_GPUS=1 \
  make finetune-arx DATASET=/path/to/arx_lerobot_dataset

脚本会依次做全量 parquet/video 运行时校验、刷新 stats.json / relative_stats.json、验证统计与 metadata,再运行官方 loader smoke,最后从 nvidia/GR00T-N1.7-3B 启动官方微调入口。多卡时显式列出同样数量的 GPU,例如 CUDA_VISIBLE_DEVICES=0,1 NUM_GPUS=2;已有输出不会被静默覆盖,断点续训需设置 RESUME=1 OUTPUT_DIR=/path/to/existing/run

手工复制官方仓库里的 uv run 命令到新终端时,必须先导出根目录 .env;优先使用本工作区的 make/scripts wrapper,因为 uv 本身不会自动读取父目录配置。

Contributors

wee733

3 commits

wee733/Arx_GROOT

finetune isaacros groot n1.7 for arxr5a arm manipulation

0

stars

3

commits

Python

primary language

Jul 27, 2026

updated

README

Isaac GR00T N1.7 + ARX-R5 入门工作区

当前服务器入口:请先阅读 服务器复现与 ARX 后续计划。无代理环境优先按 离线工件传输 搬运模型缓存。

这个工作区把 NVIDIA 当前的 GR00T N1.7 GA 教程固定成一套可重复执行的本机流程,并把后续 ARX-R5 接入所需的数据与控制接口单独定义出来。

当前服务器状态(2026-07-24)

已完成:

  • 服务器有 6 张 RTX PRO 6000 Blackwell Server Edition,每张约 96 GB VRAM;/data2 还有约 1.1 TiB,可承担完整微调。
  • 所有大型工件均配置在 /data2/buaalibozhao/gr00t-n1.7,避免写满只剩约 25 GB 的系统盘。
  • NVIDIA 官方仓库已固定到 N1.7 GA 提交 9c7e746b2cd37a810070a98ef41d290a07e806c2;5 组官方 demo 与 54 个 LFS 对象已通过完整性校验。
  • Python 3.12 / PyTorch 2.9 cu128 环境已创建;make verify-runtime 已通过核心 imports、CUDA 可见性、Blackwell capability 12.0 和官方 DROID AV1 抽帧解码。
  • 固定版 flash-attn wheel 已在服务器,SHA-256 与官方锁文件一致。
  • 固定 revision 的 nvidia/GR00T-N1.7-3B 与 gated nvidia/Cosmos-Reason2-2B cache 已完成 SHA-256、默认模型 ID 离线解析、 processor 解析和完整 31.44 亿参数 CPU 权重加载验证。
  • 无权重 ReplayPolicy server/client smoke 已通过。
  • ARX-R5 NEW_EMBODIMENT 的 6 轴手臂 + 1 维夹爪、front/wrist 双相机、raw-v1 转换、深度验证、统计、微调和开环入口已准备。

当前尚未执行 GPU 上的 DROID open-loop 和两步 ARX 微调 smoke;2026-07-24 复核时 6 张 GPU 均有其他用户的活跃训练任务,未抢占。服务器侧模型、数据和训练入口已经达到“收到合格数据即可开训”的状态;有明确空闲 GPU 后补跑这两项最终 smoke。

已验证参考基线(5090,2026-07-21)

以下结果来自原 5090 环境,不代表当前服务器已经重跑:

  • Isaac Sim 5.1.0、Isaac Lab 2.3.2、Isaac ROS 4.5/Jazzy 和 ARX cuMotion 工程已审计。
  • Franka Mimic 示例已回放;N1.7 DROID 开环已通过,参考平均 MSE 0.020047、MAE 0.076498、稳态约 0.2580 s/次
  • 当时 base 与 Cosmos 均已缓存,CUDA、flash-attn、torchcodec 和 DROID AV1 解码均通过。

完整历史结果见 N1.7 运行报告

最短运行路径

cd /home/buaalibozhao/Arx_GROOT
# 新 clone 才需要:cp .env.example .env,并把所有大目录设到 /data2

当前服务器按以下顺序收尾:

make preflight
make setup              # 幂等;完成/修复固定 Python 环境
make verify-runtime     # 已通过;环境或驱动变化后重跑
make verify-data
make verify-model-cache # 已通过;cache 或磁盘变化后重跑
make replay-smoke
make open-loop          # 需选择明确空闲的 GPU

在共享服务器上运行 open-loop 或微调前先检查 GPU 进程归属,不要占用其他用户的任务。

若要看策略服务接口:

# Terminal 1
make server

# Terminal 2
make client

应该怎样理解这几个 NVIDIA 组件

Isaac Sim / Isaac Lab       任务环境、示教采集、Mimic 数据扩增
            │
            ▼
GR00T LeRobot-v2 数据       RGB + state + action + language
            │
            ▼
GR00T N1.7                  从视觉/语言预测动作 chunk
            │
            ▼
ARX ROS adapter             关节顺序、单位、限位、watchdog、控制器调用
            │
            ├── Isaac Sim TopicBasedSystem(先验证)
            └── ARX 实机 ros2_control(安全门控后)

cuMotion / MoveIt           独立承担规划、IK、碰撞和约束,不会自动变成 GR00T embodiment

GR00T 不是 cuMotion 的替代品,也不会读取 MoveIt/XRDF 后自动理解 ARX。base checkpoint 的 XDOF tag 是三视角、双臂/双夹爪数据契约,不能把输出直接发送给单臂 ARX 实机。可靠路线是用 ARX 自己的示教数据微调 NEW_EMBODIMENT

推荐的学习顺序

  1. make open-loop:DROID 数据上的官方 N1.7 base 推理。
  2. SimplerEnv-Fractal:Google Robot 的官方 finetuned checkpoint 闭环仿真。
  3. make isaaclab-mimic-smoke:复用本机 Isaac Lab,理解示教、Mimic 扩增和 BC 数据链路。
  4. SO100 NEW_EMBODIMENT 与 ARX 两步训练 smoke:先验证自定义机械臂 loader/loss/checkpoint;模型 cache 到位后,当前 6×96 GB 服务器可承担正式微调。
  5. 给现有 ARX Isaac Sim 场景增加 front/wrist RGB、任务物体、reset 和成功判定。
  6. 采集 ARX 仿真/实机数据,离线验证后再接 PolicyServer;最后才做受控实机试验。

详细命令见:

目录

Isaac-GR00T/                 NVIDIA 官方源码,固定 GA commit,不在其中做 ARX 修改
configs/arx_r5/              ARX NEW_EMBODIMENT 模板
datasets/isaaclab_mimic/     NVIDIA/Isaac Lab 官方小型 Franka 数据
docs/                        教程、审计和接入说明
scripts/                     可重复执行的检查、安装、推理与验证脚本

运行 make help 可查看所有入口。

服务器完成 make verify-runtimemake verify-model-cache,再收到符合 ARX 6+1 双相机契约的数据后,可直接启动微调:

CUDA_VISIBLE_DEVICES=0 NUM_GPUS=1 \
  make finetune-arx DATASET=/path/to/arx_lerobot_dataset

脚本会依次做全量 parquet/video 运行时校验、刷新 stats.json / relative_stats.json、验证统计与 metadata,再运行官方 loader smoke,最后从 nvidia/GR00T-N1.7-3B 启动官方微调入口。多卡时显式列出同样数量的 GPU,例如 CUDA_VISIBLE_DEVICES=0,1 NUM_GPUS=2;已有输出不会被静默覆盖,断点续训需设置 RESUME=1 OUTPUT_DIR=/path/to/existing/run

手工复制官方仓库里的 uv run 命令到新终端时,必须先导出根目录 .env;优先使用本工作区的 make/scripts wrapper,因为 uv 本身不会自动读取父目录配置。

Contributors

wee733

3 commits

Languages

Python

68.7%

Shell

27.6%

Makefile

3.7%