11 repos
Libraries and frameworks for training and deploying transformer-based models in robotic control and manipulation tasks. The cluster centers on multimodal vision-language models adapted for robot learning, with implementations spanning pretraining pipelines, fine-tuning on robot datasets (LIBERO, DROID, BimanualYAM), and inference optimization using modern serialization formats like safetensors. Repositories here focus on bridging computer vision and natural language understanding for embodied AI applications.