当前服务器入口:请先阅读 服务器复现与 ARX 后续计划。无代理环境优先按 离线工件传输 搬运模型缓存。
这个工作区把 NVIDIA 当前的 GR00T N1.7 GA 教程固定成一套可重复执行的本机流程,并把后续 ARX-R5 接入所需的数据与控制接口单独定义出来。
已完成:
/data2 还有约 1.1 TiB,可承担完整微调。/data2/buaalibozhao/gr00t-n1.7,避免写满只剩约 25 GB 的系统盘。9c7e746b2cd37a810070a98ef41d290a07e806c2;5 组官方 demo 与 54 个 LFS 对象已通过完整性校验。make verify-runtime 已通过核心 imports、CUDA 可见性、Blackwell capability 12.0 和官方 DROID AV1 抽帧解码。nvidia/GR00T-N1.7-3B 与 gated
nvidia/Cosmos-Reason2-2B cache 已完成 SHA-256、默认模型 ID 离线解析、
processor 解析和完整 31.44 亿参数 CPU 权重加载验证。ReplayPolicy server/client smoke 已通过。NEW_EMBODIMENT 的 6 轴手臂 + 1 维夹爪、front/wrist 双相机、raw-v1 转换、深度验证、统计、微调和开环入口已准备。当前尚未执行 GPU 上的 DROID open-loop 和两步 ARX 微调 smoke;2026-07-24 复核时 6 张 GPU 均有其他用户的活跃训练任务,未抢占。服务器侧模型、数据和训练入口已经达到“收到合格数据即可开训”的状态;有明确空闲 GPU 后补跑这两项最终 smoke。
以下结果来自原 5090 环境,不代表当前服务器已经重跑:
0.020047、MAE 0.076498、稳态约 0.2580 s/次。完整历史结果见 N1.7 运行报告。
cd /home/buaalibozhao/Arx_GROOT
# 新 clone 才需要:cp .env.example .env,并把所有大目录设到 /data2
当前服务器按以下顺序收尾:
make preflight
make setup # 幂等;完成/修复固定 Python 环境
make verify-runtime # 已通过;环境或驱动变化后重跑
make verify-data
make verify-model-cache # 已通过;cache 或磁盘变化后重跑
make replay-smoke
make open-loop # 需选择明确空闲的 GPU
在共享服务器上运行 open-loop 或微调前先检查 GPU 进程归属,不要占用其他用户的任务。
若要看策略服务接口:
# Terminal 1
make server
# Terminal 2
make client
Isaac Sim / Isaac Lab 任务环境、示教采集、Mimic 数据扩增
│
▼
GR00T LeRobot-v2 数据 RGB + state + action + language
│
▼
GR00T N1.7 从视觉/语言预测动作 chunk
│
▼
ARX ROS adapter 关节顺序、单位、限位、watchdog、控制器调用
│
├── Isaac Sim TopicBasedSystem(先验证)
└── ARX 实机 ros2_control(安全门控后)
cuMotion / MoveIt 独立承担规划、IK、碰撞和约束,不会自动变成 GR00T embodiment
GR00T 不是 cuMotion 的替代品,也不会读取 MoveIt/XRDF 后自动理解 ARX。base checkpoint 的 XDOF tag 是三视角、双臂/双夹爪数据契约,不能把输出直接发送给单臂 ARX 实机。可靠路线是用 ARX 自己的示教数据微调 NEW_EMBODIMENT。
make open-loop:DROID 数据上的官方 N1.7 base 推理。make isaaclab-mimic-smoke:复用本机 Isaac Lab,理解示教、Mimic 扩增和 BC 数据链路。NEW_EMBODIMENT 与 ARX 两步训练 smoke:先验证自定义机械臂 loader/loss/checkpoint;模型 cache 到位后,当前 6×96 GB 服务器可承担正式微调。详细命令见:
Isaac-GR00T/ NVIDIA 官方源码,固定 GA commit,不在其中做 ARX 修改
configs/arx_r5/ ARX NEW_EMBODIMENT 模板
datasets/isaaclab_mimic/ NVIDIA/Isaac Lab 官方小型 Franka 数据
docs/ 教程、审计和接入说明
scripts/ 可重复执行的检查、安装、推理与验证脚本
运行 make help 可查看所有入口。
服务器完成 make verify-runtime 和 make verify-model-cache,再收到符合 ARX 6+1 双相机契约的数据后,可直接启动微调:
CUDA_VISIBLE_DEVICES=0 NUM_GPUS=1 \
make finetune-arx DATASET=/path/to/arx_lerobot_dataset
脚本会依次做全量 parquet/video 运行时校验、刷新 stats.json / relative_stats.json、验证统计与 metadata,再运行官方 loader smoke,最后从
nvidia/GR00T-N1.7-3B 启动官方微调入口。多卡时显式列出同样数量的 GPU,例如
CUDA_VISIBLE_DEVICES=0,1 NUM_GPUS=2;已有输出不会被静默覆盖,断点续训需设置
RESUME=1 OUTPUT_DIR=/path/to/existing/run。
手工复制官方仓库里的 uv run 命令到新终端时,必须先导出根目录 .env;优先使用本工作区的 make/scripts wrapper,因为 uv 本身不会自动读取父目录配置。
3 commits
Python
68.7%
Shell
27.6%
Makefile
3.7%
当前服务器入口:请先阅读 服务器复现与 ARX 后续计划。无代理环境优先按 离线工件传输 搬运模型缓存。
这个工作区把 NVIDIA 当前的 GR00T N1.7 GA 教程固定成一套可重复执行的本机流程,并把后续 ARX-R5 接入所需的数据与控制接口单独定义出来。
已完成:
/data2 还有约 1.1 TiB,可承担完整微调。/data2/buaalibozhao/gr00t-n1.7,避免写满只剩约 25 GB 的系统盘。9c7e746b2cd37a810070a98ef41d290a07e806c2;5 组官方 demo 与 54 个 LFS 对象已通过完整性校验。make verify-runtime 已通过核心 imports、CUDA 可见性、Blackwell capability 12.0 和官方 DROID AV1 抽帧解码。nvidia/GR00T-N1.7-3B 与 gated
nvidia/Cosmos-Reason2-2B cache 已完成 SHA-256、默认模型 ID 离线解析、
processor 解析和完整 31.44 亿参数 CPU 权重加载验证。ReplayPolicy server/client smoke 已通过。NEW_EMBODIMENT 的 6 轴手臂 + 1 维夹爪、front/wrist 双相机、raw-v1 转换、深度验证、统计、微调和开环入口已准备。当前尚未执行 GPU 上的 DROID open-loop 和两步 ARX 微调 smoke;2026-07-24 复核时 6 张 GPU 均有其他用户的活跃训练任务,未抢占。服务器侧模型、数据和训练入口已经达到“收到合格数据即可开训”的状态;有明确空闲 GPU 后补跑这两项最终 smoke。
以下结果来自原 5090 环境,不代表当前服务器已经重跑:
0.020047、MAE 0.076498、稳态约 0.2580 s/次。完整历史结果见 N1.7 运行报告。
cd /home/buaalibozhao/Arx_GROOT
# 新 clone 才需要:cp .env.example .env,并把所有大目录设到 /data2
当前服务器按以下顺序收尾:
make preflight
make setup # 幂等;完成/修复固定 Python 环境
make verify-runtime # 已通过;环境或驱动变化后重跑
make verify-data
make verify-model-cache # 已通过;cache 或磁盘变化后重跑
make replay-smoke
make open-loop # 需选择明确空闲的 GPU
在共享服务器上运行 open-loop 或微调前先检查 GPU 进程归属,不要占用其他用户的任务。
若要看策略服务接口:
# Terminal 1
make server
# Terminal 2
make client
Isaac Sim / Isaac Lab 任务环境、示教采集、Mimic 数据扩增
│
▼
GR00T LeRobot-v2 数据 RGB + state + action + language
│
▼
GR00T N1.7 从视觉/语言预测动作 chunk
│
▼
ARX ROS adapter 关节顺序、单位、限位、watchdog、控制器调用
│
├── Isaac Sim TopicBasedSystem(先验证)
└── ARX 实机 ros2_control(安全门控后)
cuMotion / MoveIt 独立承担规划、IK、碰撞和约束,不会自动变成 GR00T embodiment
GR00T 不是 cuMotion 的替代品,也不会读取 MoveIt/XRDF 后自动理解 ARX。base checkpoint 的 XDOF tag 是三视角、双臂/双夹爪数据契约,不能把输出直接发送给单臂 ARX 实机。可靠路线是用 ARX 自己的示教数据微调 NEW_EMBODIMENT。
make open-loop:DROID 数据上的官方 N1.7 base 推理。make isaaclab-mimic-smoke:复用本机 Isaac Lab,理解示教、Mimic 扩增和 BC 数据链路。NEW_EMBODIMENT 与 ARX 两步训练 smoke:先验证自定义机械臂 loader/loss/checkpoint;模型 cache 到位后,当前 6×96 GB 服务器可承担正式微调。详细命令见:
Isaac-GR00T/ NVIDIA 官方源码,固定 GA commit,不在其中做 ARX 修改
configs/arx_r5/ ARX NEW_EMBODIMENT 模板
datasets/isaaclab_mimic/ NVIDIA/Isaac Lab 官方小型 Franka 数据
docs/ 教程、审计和接入说明
scripts/ 可重复执行的检查、安装、推理与验证脚本
运行 make help 可查看所有入口。
服务器完成 make verify-runtime 和 make verify-model-cache,再收到符合 ARX 6+1 双相机契约的数据后,可直接启动微调:
CUDA_VISIBLE_DEVICES=0 NUM_GPUS=1 \
make finetune-arx DATASET=/path/to/arx_lerobot_dataset
脚本会依次做全量 parquet/video 运行时校验、刷新 stats.json / relative_stats.json、验证统计与 metadata,再运行官方 loader smoke,最后从
nvidia/GR00T-N1.7-3B 启动官方微调入口。多卡时显式列出同样数量的 GPU,例如
CUDA_VISIBLE_DEVICES=0,1 NUM_GPUS=2;已有输出不会被静默覆盖,断点续训需设置
RESUME=1 OUTPUT_DIR=/path/to/existing/run。
手工复制官方仓库里的 uv run 命令到新终端时,必须先导出根目录 .env;优先使用本工作区的 make/scripts wrapper,因为 uv 本身不会自动读取父目录配置。
3 commits
Python
68.7%
Shell
27.6%
Makefile
3.7%