Daily AI/Robotics paper briefings (VLA, World Model, Physical AI)
Python
24
137 commits
updated Aug 11, 2026
VLA, World Model, Physical AI 관련 논문을 매일 자동으로 검색하고 한국어로 요약합니다.
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | World Tokens: Enhancing Embodied Policies with Training-Time World Modeling | Qu Tang, Benhui Zhuang, Bo Yuan | arXiv |
| 2026-08-10 | AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models | Guiyu Zhao, Longteng Guo, Yanghong Mei | arXiv |
| 2026-08-09 | PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud | Chenghua Wang, Daliang Xu, Dongqi Cai | arXiv |
| 2026-08-09 | $ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation | Zhe Li, Zhenzhe Zhang, Yangyang Wei | arXiv |
| 2026-08-08 | DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation | Junfeng Li, Junjie He, Zhide Zhong | arXiv |
| 2026-08-08 | Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation | He Kong, Zengjue Chen, Qi Wang | arXiv |
| 2026-08-08 | SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation | Changyuan Wang, Chubin Zhang, Zhenyu Wu | arXiv |
| 2026-08-06 | GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs | Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta | arXiv |
| 2026-08-06 | BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation | Peiyan Li, Yuze Zhu, Yixiang Chen | arXiv |
| 2026-08-06 | Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models | Xingyu Ding, Yuzhong Zhao, Yang Wu | arXiv |
| 2026-08-06 | Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference | Zheng Liu, Zeyu Guo, Zihan Liu | arXiv |
| 2026-08-03 | FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling | Li Lin, Wujun Xu, Weiwei Meng | arXiv |
| 2026-08-03 | WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning | Senyu Fei, Xiaopeng Yu, Siyin Wang | arXiv |
| 2026-08-02 | A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference | Zhuoran Song, Haozhe Jiang, Chunyu Qi | arXiv |
| 2026-08-02 | Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline | Qing Yang, Xun Wang, Ziguan Wang | arXiv |
| 2026-07-31 | ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine | Yukang Cao, Haozhe Xie, Beichen Wen | arXiv |
| 2026-07-30 | CG-World: A Large-Scale World-State Dataset and Protocol for World Models | Yiming Cai, Fangjie Yu, Meiqing Yu | arXiv |
| 2026-07-30 | TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM | Hengyi Xie, Chenfei Yao, Xianjin Wu | arXiv |
| 2026-07-30 | RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models | Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer | arXiv |
| 2026-07-30 | CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation | Yushan Liu, Peibo Sun, Xintao Chao | arXiv |
| 2026-07-30 | DLAM: Distributional Latent Actions with Temporal Constraints | Zuojin Tang, Feifan Luo, Haoyun Liu | arXiv |
| 2026-07-29 | CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model | Minhyeok Lee, Chiyoung Kim, Chanhoe Gu | arXiv |
| 2026-07-29 | SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models | Zonghe Liu, Shanyuan Jie, Xiaoquan Sun | arXiv |
| 2026-07-29 | A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models | Haoyu Zhang, Yuwei Wu, Jin Chen | arXiv |
| 2026-07-28 | Data Pyramid for Embodied Manipulation | Yifan Ye, Yankai Fu, Yaoxu Lv | arXiv |
| 2026-07-28 | τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision | Ning Cheng, Jinan Xu, Wanlin Li | arXiv |
| 2026-07-25 | AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation | Mengfei Zhao, Dihong Huang, Yikai Tang | arXiv |
| 2026-07-24 | HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving | Quanfu Yu, Xian Wu, Hao Xu | arXiv |
| 2026-07-24 | Emergent Compositional Skills in Mixture-of-Experts VLAs | Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss | arXiv |
| 2026-07-23 | Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids | Roger Sala Sisó, Tiago Silvério, Jakob Sand | arXiv |
| 2026-07-23 | ReferTrack: Referring Then Tracking for Embodied Visual Tracking | Hanjing Ye, Tianle Zeng, Jiazhao Zhang | arXiv |
| 2026-07-22 | RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation | Ziqin Wang, Hao Li, Weijun Wang | arXiv |
| 2026-07-21 | Patch Policy: Efficient Embodied Control via Dense Visual Representations | Gaoyue Zhou, Zichen Jeff Cui, Ada Langford | arXiv |
| 2026-07-21 | PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution | Yang Liu, Weixing Chen, Xinshuai Song | arXiv |
| 2026-07-21 | FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation | Ruicheng Li, Qixiu Li, Ruichun Ma | arXiv |
| 2026-07-21 | RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model | Kehan Li, Bohan Hou, Minghao Zhu | arXiv |
| 2026-07-20 | IMBench: A Benchmark for Intuitive Robotic Manipulation | Anurag Maurya, Sukhvansh Jain, Prajwal Avhad | arXiv |
| 2026-07-20 | JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models | Haoran Sun, Wentao Zhang, Junyang Hua | arXiv |
| 2026-07-19 | Video = World + Event Stream | Lianghua Huang, Zhi-Fan Wu, Yupeng Shi | arXiv |
| 2026-07-17 | CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking | Ruilong Ren, Songsheng Cheng, Yunpeng Zhou | arXiv |
| 2026-07-17 | Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic Manipulation | Yao He, Gan Sun, Wenqi Liang | arXiv |
| 2026-07-17 | RoboTTT: Context Scaling for Robot Policies | Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng | arXiv |
| 2026-07-16 | S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving | Jianguo Yu, Rukang Wang, Duanfeng Chu | arXiv |
| 2026-07-15 | TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors | Pinhan Fu, Xianda Guo, Xuetao Li | arXiv |
| 2026-07-15 | Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference | Zebin Yang, Qi Wang, Yunhe Wang | arXiv |
| 2026-07-15 | ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning | Yilun Kong, Yunpeng Qing, Guozheng Ma | arXiv |
| 2026-07-14 | From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence | Yuanzhi Liang, Xufeng Zhan, Haibin Huang | arXiv |
| 2026-07-12 | DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation | Yunchao Yao, Zhuxiu Xu, Tianqi Zhang | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation | Peterson Co, Sicheng Hu, Chunxuan Jiao | arXiv |
| 2026-08-11 | Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning | Haodong Li, Shaoteng Liu, Tianyu Wang | arXiv |
| 2026-08-11 | Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning | Yapeng Liu, Yuanzhao Zhai, Bo Ding | arXiv |
| 2026-08-09 | MASS: Multiplayer World Models with Authoritative Shared State | Ziqi Cai, Siqi Yang, Yimu Wang | arXiv |
| 2026-08-09 | From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models | Jiale Han, Xiang Li, Jing Qian | arXiv |
| 2026-08-09 | MiniWorld: Democratizing the Training of Video World Models from Scratch | Yian Zhao, Ruochong Zheng, Hongcan Guo | arXiv |
| 2026-08-08 | GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions | Chenghao Gu, Hanyang Yu, Jingbo Zhang | arXiv |
| 2026-08-08 | XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments? | Yixiang Chen, Jiabing Yang, Yuan Xu | arXiv |
| 2026-08-07 | From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks | Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad | arXiv |
| 2026-08-05 | Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability | Gil Sasson, Zachary Levine, Smadar Shilo | arXiv |
| 2026-08-05 | HP-JEPA: Hierarchical Partitioning for Multi-Resolution Graph Joint-Embedding Predictive Learning | Ruichen Xu, Jingxiang Qu, Wenhan Gao | arXiv |
| 2026-08-03 | DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search | Jiayang Niu, Yan Wang, Jie Li | arXiv |
| 2026-08-01 | QQWorld: Quantile-Quantile Matching for World Model Regularization | Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu | arXiv |
| 2026-08-01 | ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow | Jin Cao, Zian Meng, Kaipeng Zhang | arXiv |
| 2026-08-01 | Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 | Jens Lehmann, Andrei Aioanei, Sahar Vahdati | arXiv |
| 2026-08-01 | Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation | Fazhong Liu, Zhuoyan Chen, Haozhen Tan | arXiv |
| 2026-07-31 | PhiZero: A World Model Built Around Physical Language | Shuyao Shang, Yuqi Wang, Ruopeng Gao | arXiv |
| 2026-07-31 | AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans | Jingwen Yang, Senmao Wang, Luoyao Kang | arXiv |
| 2026-07-29 | INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models | Junhan Sun, Hao Zhao, Guofeng Zhang | arXiv |
| 2026-07-29 | Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance | Gaspard Lambrechts, Adrien Bolland, Daniel Ebi | arXiv |
| 2026-07-27 | Robot-Factored World Models via Robot Rendering | Byungjun Kim, Taeksoo Kim, Hyunsoo Cha | arXiv |
| 2026-07-27 | ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation | Yunao Huang, Shiyu Sang, Haotao Lu | arXiv |
| 2026-07-27 | Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound | Siqi Fan, Mingcong Chen, Ran Liu | arXiv |
| 2026-07-27 | On the Identifiability of Controlled World Models | Xiangteng Zhang, Yang Guan, Bo Zhang | arXiv |
| 2026-07-25 | PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration | Han Wang, Zijun Wang, Shuoshuo Xue | arXiv |
| 2026-07-23 | KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding | Zeyu Liu, Zhangzhe Zhu, Yang Zhang | arXiv |
| 2026-07-22 | ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU | Fan Jiang, Zhaoxu Sun, Mengchao Wang | arXiv |
| 2026-07-22 | Masked Visual Actions for Unified World Modeling | Hadi Alzayer, Wenlong Huang, Haonan Chen | arXiv |
| 2026-07-21 | Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence | Runmao Yao, Kairui Hu, Yukang Cao | arXiv |
| 2026-07-18 | DriftWorld: Fast World Modeling through Drifting | Susie Lu, Haonan Chen, Weirui Ye | arXiv |
| 2026-07-18 | Concept-Guided Spatial Regularization for World Models in Atari Pong | Yukuan Lu, Zaishuo Xia, Weyl Lu | arXiv |
| 2026-07-18 | Hierarchical Denoising For Multi-Step Visual Reasoning | Zezhong Qian, Xiaowei Chi, Chak-Wing Mak | arXiv |
| 2026-07-16 | Grounded world models in biological organisms and future embodied AI | Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro | arXiv |
| 2026-07-14 | Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model | Xinghang Li, Jun Guo, Qiwei Li | arXiv |
| 2026-07-12 | A Definition and Roadmap for World Models | Xinyuan Chen, Haoyu Guo, Shi Guo | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance | Dongchi Huang, Hongyin Zhang, Bohan Hou | arXiv |
| 2026-08-07 | IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation | Zhixiang Chen, Zhuangbin Chen, Ruoxi Jia | arXiv |
| 2026-08-07 | Principles of Robot Autonomy | Daniele Gammelli, Joseph Lorenzetti, Katie Luo | arXiv |
| 2026-08-03 | Diagnosing Compositional Generalization in Sequential Robot Tasks | Yixiao Wang, Cheng-En Wu, Lingfeng Sun | arXiv |
| 2026-08-02 | From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence | Jia Luo | arXiv |
| 2026-08-02 | Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels | Xinyu Yang, Tianxing Chen, Honghao Su | arXiv |
| 2026-08-02 | Physical AI Governance: From Theory to Practice Across Life Cycle | Wang Yang, Shaobo Wang, Hongxuan Liu | arXiv |
| 2026-08-01 | MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation | Dawei Wang, Di Zhao, Xinyuan Liu | arXiv |
| 2026-07-31 | Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer | Weiquan Lin, Yu Deng, Shiyang Liu | arXiv |
| 2026-07-26 | TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects | Ke Ma, Yifei Wang, Meng Wang | arXiv |
| 2026-07-26 | GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning | Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai | arXiv |
| 2026-07-25 | Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards | Gabriele Franchini, Giulio Mallardi, Michele De Carolis | arXiv |
| 2026-07-18 | GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI | Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan | arXiv |
| 2026-07-14 | Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles | Ashiyana Abdul Majeed, Mahmoud Meribout, Neethu Joseph | arXiv |
| 2026-07-13 | Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference | Junfei Zhan, Haoxun Shen, Mingang Guo | arXiv |
| 2026-07-12 | ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI | ACE-Brain Team, :, Ziyang Gong | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-05 | Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning? | Perry Dong, Ron Polonsky, Dorsa Sadigh | arXiv |
| 2026-07-25 | Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation | Yu Qi, Zhang Ye, Xinyi Xu | arXiv |
| 2026-07-22 | Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing | Xinjie Zhang, Peng Zhang, Shicheng Zheng | arXiv |
| 2026-07-19 | SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment | Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera | arXiv |
| 2026-07-17 | Scaling Behavior Foundation Model for Humanoid Robots | Weishuai Zeng, Kangning Yin, Xiaojie Niu | arXiv |
| 2026-07-15 | Hy-Embodied-VLM-1.0: Efficient Physical-World Agents | Ziyi Wang, Xumin Yu, Yongming Rao | arXiv |
| 2026-07-15 | ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models | Haojie Ren, Songrui Luo, Lingfeng Wang | arXiv |
| 2026-07-13 | What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility | Filippo Ziliotto, Luciano Serafini, Lamberto Ballan | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-10 | Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems | Zhongchao Zhou, Yixuan Xie, Wenwei Yu | arXiv |
| 2026-08-10 | Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits | Elena Dumitrescu, Gert Lek, Lydia Y. Chen | arXiv |
| 2026-08-10 | RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs | Qiyanhui Lu, Han Wu, Rongjian Xu | arXiv |
| 2026-08-10 | Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation | Junghwan Park, Sangcheol Sim, Woojin Cho | arXiv |
| 2026-08-07 | QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding | Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya | arXiv |
| 2026-08-07 | The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping | Sarvesh Baskar, Zikui Cai, Shayan Shabihi | arXiv |
| 2026-08-06 | AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance | Wayne Wonseok Rodgers, Xiangyi Le, Seonghoon Jang | arXiv |
| 2026-08-05 | Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? | Filippo Lazzati, Kyle Stachowicz, William Chen | arXiv |
| 2026-08-05 | LieStoNet: Learning Lie Symmetries from Spatiotemporal Data for Stochastic Dynamical Systems | Shida Liu, Abhishek Gupta, Sumit Sinha | arXiv |
| 2026-08-03 | Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration | Dylan Miller, Martin Jagersand | arXiv |
| 2026-07-31 | Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles | Luca de Martino, Federico Aromolo, Federico Nesti | arXiv |
| 2026-07-28 | Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG | Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot | arXiv |
| 2026-07-28 | ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding | Hangjie Yuan, Yichen Qian, Zhiwei Tang | arXiv |
| 2026-07-28 | Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating | Maruthi Vemula, Neeraj Praneeth Gajula | arXiv |
| 2026-07-27 | Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance Axes | Mihael Simonič, Xiaocong Li | arXiv |
| 2026-07-26 | Expert Behavior Prior Reinforcement Learning | Gong Gao, Weidong Zhao, Xianhui Liu | arXiv |
| 2026-07-26 | RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy | Xiao Zhang, Jiaxuan Li, Renzhen Le | arXiv |
| 2026-07-26 | Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment | Renzhen Le, Xiao Zhang, Di Wu | arXiv |
| 2026-07-25 | Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar | Simone Arreghini, Mirko Nava, Nicholas Carlotti | arXiv |
| 2026-07-24 | Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window | Yukun Shi, Minglun Gong | arXiv |
| 2026-07-24 | Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs | Muyang Du, Shuang Yu, Junjie Lai | arXiv |
| 2026-07-24 | Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering | Zikui Cai, Kaushal Janga, Tan Dat Dao | arXiv |
| 2026-07-23 | V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits | Shahd Shami, Obadah Wali, Eric Feron | arXiv |
| 2026-07-23 | DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations | Jiazhen Jiang, Boxi Cao, Lingyong Yan | arXiv |
| 2026-07-22 | NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion | Sanket Sharma | arXiv |
| 2026-07-20 | Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation | Zhenduo Shang, Xiyao Liu, Bohan Li | arXiv |
| 2026-07-20 | Vision-Language Assistant for Emotional Reactions to Risky Driving | Harine Choi, Eun Hak Lee, Zhengzhong Tu | arXiv |
| 2026-07-20 | PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety Assessment | Tam Bang, Hussam Abubakr, Emiliano de la Garza Villarreal | arXiv |
| 2026-07-19 | AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent Prediction | Seok Joon Kim, Junho Lee, Federica Spinola | arXiv |
| 2026-07-19 | Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults | Aniol Civit, Antonio Andriella, Alba Martínez | arXiv |
| 2026-07-19 | Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling | Jonathan Rainer Lippert, Kai Ploeger, Abir Chowdhury | arXiv |
| 2026-07-18 | BadWAM: When World-Action Models Dream Right but Act Wrong | Qi Li, Xingyi Yang, Xinchao Wang | arXiv |
| 2026-07-17 | AutoSynthesis: An agentic system for automated meta-analysis | Moein Taherinezhad, Sebastian Maier, Gerardo Vitagliano | arXiv |
| 2026-07-16 | Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education | Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou | arXiv |
| 2026-07-16 | Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 | Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi | arXiv |
| 2026-07-16 | AI-accelerated End-to-End Framework for Rapid Professional Upskilling | Tam Nguyen, Hung Nguyen, Robert Ogburn | arXiv |
| 2026-07-14 | Transformer-Guided Swarm Intelligence for Frugal Neural Architecture Search | Romain Amigon | arXiv |
| 2026-07-14 | DA-Nav: Direction-Aware City-Scale Vision-Language Navigation | Ye Yuan, Kehan Chen, Xinqiang Yu | arXiv |
| 2026-07-13 | VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents | Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj | arXiv |
| 2026-07-13 | Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks | Nuocheng Yang, Sihua Wang, Zihan Chen | arXiv |
| 2026-07-13 | Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks | Yangting Sun, Zijun Cui, Yufei Zhang | arXiv |
| 2026-07-12 | ContactMimic: Humanoid Object Interaction via Contact Control | Xinyao Li, Xialin He, Runpei Dong | arXiv |
| 2026-07-12 | Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups | Jaeho Shin, Maani Ghaffari, Yulun Tian | arXiv |
awesome-vla-study 기반 커리큘럼
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 1 | RT-1: Robotics Transformer — Brohan et al. (2022) | 2212.06817 | First large-scale Robotics Transformer |
| 2 | RT-2: Vision-Language-Action Models — Brohan et al. (2023) | 2307.15818 | VLM backbone → VLA paradigm |
| 3 | Octo — Ghosh et al. (2024) | 2405.12213 | Open-source generalist policy, OXE pretrained |
| 4 | OpenVLA — Kim et al. (2024) | 2406.09246 | First open-source VLM-based VLA |
| 5 | BeT — Shafiullah et al. (2022) | 2206.11251 | Multimodal action discretization |
| 6 | Diffusion Policy — Chi et al. (2023) | 2303.04137 | Diffusion for robot control |
| 7 | ACT/ALOHA — Zhao et al. (2023) | 2304.13705 | Action Chunking Transformer, bimanual |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 8 | CogACT — Li et al. (2024) | 2411.19650 | VLM + DiT action head |
| 9 | GR00T N1 — Bjorck et al. (2025) | 2503.14734 | 2B diffusion transformer, humanoid |
| 10 | X-VLA — Zheng et al. (2025) | 2510.10274 | Cross-embodiment, flow matching |
| 11 | π0 — Black et al. (2024) | 2410.24164 | Flow matching + action expert |
| 12 | InternVLA-M1 — Chen et al. (2025) | 2510.13778 | Spatial grounding → action generation |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 13 | Open X-Embodiment (OXE) — (2023) | 2310.08864 | 1M+ trajectories, 22 embodiments |
| 14 | AgiBot World — Bu et al. (2025) | 2503.06669 | 1M+ trajectories, 217 tasks |
| 15 | UMI — Chi et al. (2024) | 2402.10329 | Robot-free SE(3) data collection |
| 16 | VITRA — Li et al. (2025) | 2510.21571 | Human video → VLA training data |
| 17 | Human to Robot Transfer — Kareer et al. (2025) | 2512.22414 | Human video → robot transfer |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 18 | SmolVLA — Shukor et al. (2025) | 2506.01844 | 450M params, model compression |
| 19 | RTC — Black et al. (2025) | 2506.07339 | Async inference, freezing + inpainting |
| 20 | Helix — Figure AI (2025) | figure.ai/news/helix | Dual-system humanoid |
| 21 | Fast-in-Slow — Chen et al. (2025) | 2506.01953 | End-to-end trainable dual-system |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 22 | HIL-SERL — Luo et al. (2024) | 2410.21845 | Human-in-the-loop RL |
| 23 | SimpleVLA-RL — Li et al. (2025) | 2509.09674 | RL fine-tuning for AR VLA |
| 24 | π*0.6 / Recap — PI (2025) | 2511.14759 | RL for flow-based VLA |
| 25 | CoT-VLA — Zhao et al. (2025) | 2503.22020 | Visual chain-of-thought reasoning |
| 26 | ThinkAct — Huang et al. (2025) | 2507.16815 | Decouple reasoning from execution |
| 27 | Fast-ThinkAct — Huang et al. (2026) | 2601.09708 | Latent distillation, ~10x speed |
| 28 | UniVLA — Wang et al. (2025) | 2506.19850 | Unified AR VLA with world modeling |
| 29 | Cosmos Policy — Kim et al. (2026) | 2601.16163 | Video FM as robot policy backbone |
| 30 | DreamZero — Ye et al. (2026) | dreamzero0.github.io | Joint world+action generation |
137 commits
Python
99.0%
Daily AI/Robotics paper briefings (VLA, World Model, Physical AI)
Python
24
137 commits
updated Aug 11, 2026
VLA, World Model, Physical AI 관련 논문을 매일 자동으로 검색하고 한국어로 요약합니다.
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | World Tokens: Enhancing Embodied Policies with Training-Time World Modeling | Qu Tang, Benhui Zhuang, Bo Yuan | arXiv |
| 2026-08-10 | AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models | Guiyu Zhao, Longteng Guo, Yanghong Mei | arXiv |
| 2026-08-09 | PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud | Chenghua Wang, Daliang Xu, Dongqi Cai | arXiv |
| 2026-08-09 | $ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation | Zhe Li, Zhenzhe Zhang, Yangyang Wei | arXiv |
| 2026-08-08 | DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation | Junfeng Li, Junjie He, Zhide Zhong | arXiv |
| 2026-08-08 | Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation | He Kong, Zengjue Chen, Qi Wang | arXiv |
| 2026-08-08 | SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation | Changyuan Wang, Chubin Zhang, Zhenyu Wu | arXiv |
| 2026-08-06 | GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs | Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta | arXiv |
| 2026-08-06 | BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation | Peiyan Li, Yuze Zhu, Yixiang Chen | arXiv |
| 2026-08-06 | Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models | Xingyu Ding, Yuzhong Zhao, Yang Wu | arXiv |
| 2026-08-06 | Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference | Zheng Liu, Zeyu Guo, Zihan Liu | arXiv |
| 2026-08-03 | FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling | Li Lin, Wujun Xu, Weiwei Meng | arXiv |
| 2026-08-03 | WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning | Senyu Fei, Xiaopeng Yu, Siyin Wang | arXiv |
| 2026-08-02 | A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference | Zhuoran Song, Haozhe Jiang, Chunyu Qi | arXiv |
| 2026-08-02 | Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline | Qing Yang, Xun Wang, Ziguan Wang | arXiv |
| 2026-07-31 | ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine | Yukang Cao, Haozhe Xie, Beichen Wen | arXiv |
| 2026-07-30 | CG-World: A Large-Scale World-State Dataset and Protocol for World Models | Yiming Cai, Fangjie Yu, Meiqing Yu | arXiv |
| 2026-07-30 | TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM | Hengyi Xie, Chenfei Yao, Xianjin Wu | arXiv |
| 2026-07-30 | RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models | Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer | arXiv |
| 2026-07-30 | CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation | Yushan Liu, Peibo Sun, Xintao Chao | arXiv |
| 2026-07-30 | DLAM: Distributional Latent Actions with Temporal Constraints | Zuojin Tang, Feifan Luo, Haoyun Liu | arXiv |
| 2026-07-29 | CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model | Minhyeok Lee, Chiyoung Kim, Chanhoe Gu | arXiv |
| 2026-07-29 | SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models | Zonghe Liu, Shanyuan Jie, Xiaoquan Sun | arXiv |
| 2026-07-29 | A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models | Haoyu Zhang, Yuwei Wu, Jin Chen | arXiv |
| 2026-07-28 | Data Pyramid for Embodied Manipulation | Yifan Ye, Yankai Fu, Yaoxu Lv | arXiv |
| 2026-07-28 | τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision | Ning Cheng, Jinan Xu, Wanlin Li | arXiv |
| 2026-07-25 | AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation | Mengfei Zhao, Dihong Huang, Yikai Tang | arXiv |
| 2026-07-24 | HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving | Quanfu Yu, Xian Wu, Hao Xu | arXiv |
| 2026-07-24 | Emergent Compositional Skills in Mixture-of-Experts VLAs | Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss | arXiv |
| 2026-07-23 | Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids | Roger Sala Sisó, Tiago Silvério, Jakob Sand | arXiv |
| 2026-07-23 | ReferTrack: Referring Then Tracking for Embodied Visual Tracking | Hanjing Ye, Tianle Zeng, Jiazhao Zhang | arXiv |
| 2026-07-22 | RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation | Ziqin Wang, Hao Li, Weijun Wang | arXiv |
| 2026-07-21 | Patch Policy: Efficient Embodied Control via Dense Visual Representations | Gaoyue Zhou, Zichen Jeff Cui, Ada Langford | arXiv |
| 2026-07-21 | PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution | Yang Liu, Weixing Chen, Xinshuai Song | arXiv |
| 2026-07-21 | FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation | Ruicheng Li, Qixiu Li, Ruichun Ma | arXiv |
| 2026-07-21 | RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model | Kehan Li, Bohan Hou, Minghao Zhu | arXiv |
| 2026-07-20 | IMBench: A Benchmark for Intuitive Robotic Manipulation | Anurag Maurya, Sukhvansh Jain, Prajwal Avhad | arXiv |
| 2026-07-20 | JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models | Haoran Sun, Wentao Zhang, Junyang Hua | arXiv |
| 2026-07-19 | Video = World + Event Stream | Lianghua Huang, Zhi-Fan Wu, Yupeng Shi | arXiv |
| 2026-07-17 | CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking | Ruilong Ren, Songsheng Cheng, Yunpeng Zhou | arXiv |
| 2026-07-17 | Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic Manipulation | Yao He, Gan Sun, Wenqi Liang | arXiv |
| 2026-07-17 | RoboTTT: Context Scaling for Robot Policies | Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng | arXiv |
| 2026-07-16 | S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving | Jianguo Yu, Rukang Wang, Duanfeng Chu | arXiv |
| 2026-07-15 | TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors | Pinhan Fu, Xianda Guo, Xuetao Li | arXiv |
| 2026-07-15 | Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference | Zebin Yang, Qi Wang, Yunhe Wang | arXiv |
| 2026-07-15 | ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning | Yilun Kong, Yunpeng Qing, Guozheng Ma | arXiv |
| 2026-07-14 | From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence | Yuanzhi Liang, Xufeng Zhan, Haibin Huang | arXiv |
| 2026-07-12 | DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation | Yunchao Yao, Zhuxiu Xu, Tianqi Zhang | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation | Peterson Co, Sicheng Hu, Chunxuan Jiao | arXiv |
| 2026-08-11 | Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning | Haodong Li, Shaoteng Liu, Tianyu Wang | arXiv |
| 2026-08-11 | Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning | Yapeng Liu, Yuanzhao Zhai, Bo Ding | arXiv |
| 2026-08-09 | MASS: Multiplayer World Models with Authoritative Shared State | Ziqi Cai, Siqi Yang, Yimu Wang | arXiv |
| 2026-08-09 | From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models | Jiale Han, Xiang Li, Jing Qian | arXiv |
| 2026-08-09 | MiniWorld: Democratizing the Training of Video World Models from Scratch | Yian Zhao, Ruochong Zheng, Hongcan Guo | arXiv |
| 2026-08-08 | GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions | Chenghao Gu, Hanyang Yu, Jingbo Zhang | arXiv |
| 2026-08-08 | XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments? | Yixiang Chen, Jiabing Yang, Yuan Xu | arXiv |
| 2026-08-07 | From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks | Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad | arXiv |
| 2026-08-05 | Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability | Gil Sasson, Zachary Levine, Smadar Shilo | arXiv |
| 2026-08-05 | HP-JEPA: Hierarchical Partitioning for Multi-Resolution Graph Joint-Embedding Predictive Learning | Ruichen Xu, Jingxiang Qu, Wenhan Gao | arXiv |
| 2026-08-03 | DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search | Jiayang Niu, Yan Wang, Jie Li | arXiv |
| 2026-08-01 | QQWorld: Quantile-Quantile Matching for World Model Regularization | Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu | arXiv |
| 2026-08-01 | ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow | Jin Cao, Zian Meng, Kaipeng Zhang | arXiv |
| 2026-08-01 | Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 | Jens Lehmann, Andrei Aioanei, Sahar Vahdati | arXiv |
| 2026-08-01 | Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation | Fazhong Liu, Zhuoyan Chen, Haozhen Tan | arXiv |
| 2026-07-31 | PhiZero: A World Model Built Around Physical Language | Shuyao Shang, Yuqi Wang, Ruopeng Gao | arXiv |
| 2026-07-31 | AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans | Jingwen Yang, Senmao Wang, Luoyao Kang | arXiv |
| 2026-07-29 | INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models | Junhan Sun, Hao Zhao, Guofeng Zhang | arXiv |
| 2026-07-29 | Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance | Gaspard Lambrechts, Adrien Bolland, Daniel Ebi | arXiv |
| 2026-07-27 | Robot-Factored World Models via Robot Rendering | Byungjun Kim, Taeksoo Kim, Hyunsoo Cha | arXiv |
| 2026-07-27 | ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation | Yunao Huang, Shiyu Sang, Haotao Lu | arXiv |
| 2026-07-27 | Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound | Siqi Fan, Mingcong Chen, Ran Liu | arXiv |
| 2026-07-27 | On the Identifiability of Controlled World Models | Xiangteng Zhang, Yang Guan, Bo Zhang | arXiv |
| 2026-07-25 | PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration | Han Wang, Zijun Wang, Shuoshuo Xue | arXiv |
| 2026-07-23 | KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding | Zeyu Liu, Zhangzhe Zhu, Yang Zhang | arXiv |
| 2026-07-22 | ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU | Fan Jiang, Zhaoxu Sun, Mengchao Wang | arXiv |
| 2026-07-22 | Masked Visual Actions for Unified World Modeling | Hadi Alzayer, Wenlong Huang, Haonan Chen | arXiv |
| 2026-07-21 | Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence | Runmao Yao, Kairui Hu, Yukang Cao | arXiv |
| 2026-07-18 | DriftWorld: Fast World Modeling through Drifting | Susie Lu, Haonan Chen, Weirui Ye | arXiv |
| 2026-07-18 | Concept-Guided Spatial Regularization for World Models in Atari Pong | Yukuan Lu, Zaishuo Xia, Weyl Lu | arXiv |
| 2026-07-18 | Hierarchical Denoising For Multi-Step Visual Reasoning | Zezhong Qian, Xiaowei Chi, Chak-Wing Mak | arXiv |
| 2026-07-16 | Grounded world models in biological organisms and future embodied AI | Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro | arXiv |
| 2026-07-14 | Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model | Xinghang Li, Jun Guo, Qiwei Li | arXiv |
| 2026-07-12 | A Definition and Roadmap for World Models | Xinyuan Chen, Haoyu Guo, Shi Guo | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-11 | RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance | Dongchi Huang, Hongyin Zhang, Bohan Hou | arXiv |
| 2026-08-07 | IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation | Zhixiang Chen, Zhuangbin Chen, Ruoxi Jia | arXiv |
| 2026-08-07 | Principles of Robot Autonomy | Daniele Gammelli, Joseph Lorenzetti, Katie Luo | arXiv |
| 2026-08-03 | Diagnosing Compositional Generalization in Sequential Robot Tasks | Yixiao Wang, Cheng-En Wu, Lingfeng Sun | arXiv |
| 2026-08-02 | From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence | Jia Luo | arXiv |
| 2026-08-02 | Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels | Xinyu Yang, Tianxing Chen, Honghao Su | arXiv |
| 2026-08-02 | Physical AI Governance: From Theory to Practice Across Life Cycle | Wang Yang, Shaobo Wang, Hongxuan Liu | arXiv |
| 2026-08-01 | MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation | Dawei Wang, Di Zhao, Xinyuan Liu | arXiv |
| 2026-07-31 | Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer | Weiquan Lin, Yu Deng, Shiyang Liu | arXiv |
| 2026-07-26 | TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects | Ke Ma, Yifei Wang, Meng Wang | arXiv |
| 2026-07-26 | GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning | Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai | arXiv |
| 2026-07-25 | Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards | Gabriele Franchini, Giulio Mallardi, Michele De Carolis | arXiv |
| 2026-07-18 | GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI | Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan | arXiv |
| 2026-07-14 | Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles | Ashiyana Abdul Majeed, Mahmoud Meribout, Neethu Joseph | arXiv |
| 2026-07-13 | Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference | Junfei Zhan, Haoxun Shen, Mingang Guo | arXiv |
| 2026-07-12 | ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI | ACE-Brain Team, :, Ziyang Gong | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-05 | Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning? | Perry Dong, Ron Polonsky, Dorsa Sadigh | arXiv |
| 2026-07-25 | Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation | Yu Qi, Zhang Ye, Xinyi Xu | arXiv |
| 2026-07-22 | Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing | Xinjie Zhang, Peng Zhang, Shicheng Zheng | arXiv |
| 2026-07-19 | SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment | Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera | arXiv |
| 2026-07-17 | Scaling Behavior Foundation Model for Humanoid Robots | Weishuai Zeng, Kangning Yin, Xiaojie Niu | arXiv |
| 2026-07-15 | Hy-Embodied-VLM-1.0: Efficient Physical-World Agents | Ziyi Wang, Xumin Yu, Yongming Rao | arXiv |
| 2026-07-15 | ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models | Haojie Ren, Songrui Luo, Lingfeng Wang | arXiv |
| 2026-07-13 | What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility | Filippo Ziliotto, Luciano Serafini, Lamberto Ballan | arXiv |
| 날짜 | 제목 | 저자 | 링크 |
|---|---|---|---|
| 2026-08-10 | Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems | Zhongchao Zhou, Yixuan Xie, Wenwei Yu | arXiv |
| 2026-08-10 | Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits | Elena Dumitrescu, Gert Lek, Lydia Y. Chen | arXiv |
| 2026-08-10 | RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs | Qiyanhui Lu, Han Wu, Rongjian Xu | arXiv |
| 2026-08-10 | Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation | Junghwan Park, Sangcheol Sim, Woojin Cho | arXiv |
| 2026-08-07 | QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding | Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya | arXiv |
| 2026-08-07 | The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping | Sarvesh Baskar, Zikui Cai, Shayan Shabihi | arXiv |
| 2026-08-06 | AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance | Wayne Wonseok Rodgers, Xiangyi Le, Seonghoon Jang | arXiv |
| 2026-08-05 | Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? | Filippo Lazzati, Kyle Stachowicz, William Chen | arXiv |
| 2026-08-05 | LieStoNet: Learning Lie Symmetries from Spatiotemporal Data for Stochastic Dynamical Systems | Shida Liu, Abhishek Gupta, Sumit Sinha | arXiv |
| 2026-08-03 | Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration | Dylan Miller, Martin Jagersand | arXiv |
| 2026-07-31 | Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles | Luca de Martino, Federico Aromolo, Federico Nesti | arXiv |
| 2026-07-28 | Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG | Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot | arXiv |
| 2026-07-28 | ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding | Hangjie Yuan, Yichen Qian, Zhiwei Tang | arXiv |
| 2026-07-28 | Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating | Maruthi Vemula, Neeraj Praneeth Gajula | arXiv |
| 2026-07-27 | Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance Axes | Mihael Simonič, Xiaocong Li | arXiv |
| 2026-07-26 | Expert Behavior Prior Reinforcement Learning | Gong Gao, Weidong Zhao, Xianhui Liu | arXiv |
| 2026-07-26 | RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy | Xiao Zhang, Jiaxuan Li, Renzhen Le | arXiv |
| 2026-07-26 | Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment | Renzhen Le, Xiao Zhang, Di Wu | arXiv |
| 2026-07-25 | Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar | Simone Arreghini, Mirko Nava, Nicholas Carlotti | arXiv |
| 2026-07-24 | Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window | Yukun Shi, Minglun Gong | arXiv |
| 2026-07-24 | Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs | Muyang Du, Shuang Yu, Junjie Lai | arXiv |
| 2026-07-24 | Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering | Zikui Cai, Kaushal Janga, Tan Dat Dao | arXiv |
| 2026-07-23 | V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits | Shahd Shami, Obadah Wali, Eric Feron | arXiv |
| 2026-07-23 | DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations | Jiazhen Jiang, Boxi Cao, Lingyong Yan | arXiv |
| 2026-07-22 | NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion | Sanket Sharma | arXiv |
| 2026-07-20 | Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation | Zhenduo Shang, Xiyao Liu, Bohan Li | arXiv |
| 2026-07-20 | Vision-Language Assistant for Emotional Reactions to Risky Driving | Harine Choi, Eun Hak Lee, Zhengzhong Tu | arXiv |
| 2026-07-20 | PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety Assessment | Tam Bang, Hussam Abubakr, Emiliano de la Garza Villarreal | arXiv |
| 2026-07-19 | AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent Prediction | Seok Joon Kim, Junho Lee, Federica Spinola | arXiv |
| 2026-07-19 | Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults | Aniol Civit, Antonio Andriella, Alba Martínez | arXiv |
| 2026-07-19 | Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling | Jonathan Rainer Lippert, Kai Ploeger, Abir Chowdhury | arXiv |
| 2026-07-18 | BadWAM: When World-Action Models Dream Right but Act Wrong | Qi Li, Xingyi Yang, Xinchao Wang | arXiv |
| 2026-07-17 | AutoSynthesis: An agentic system for automated meta-analysis | Moein Taherinezhad, Sebastian Maier, Gerardo Vitagliano | arXiv |
| 2026-07-16 | Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education | Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou | arXiv |
| 2026-07-16 | Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 | Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi | arXiv |
| 2026-07-16 | AI-accelerated End-to-End Framework for Rapid Professional Upskilling | Tam Nguyen, Hung Nguyen, Robert Ogburn | arXiv |
| 2026-07-14 | Transformer-Guided Swarm Intelligence for Frugal Neural Architecture Search | Romain Amigon | arXiv |
| 2026-07-14 | DA-Nav: Direction-Aware City-Scale Vision-Language Navigation | Ye Yuan, Kehan Chen, Xinqiang Yu | arXiv |
| 2026-07-13 | VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents | Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj | arXiv |
| 2026-07-13 | Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks | Nuocheng Yang, Sihua Wang, Zihan Chen | arXiv |
| 2026-07-13 | Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks | Yangting Sun, Zijun Cui, Yufei Zhang | arXiv |
| 2026-07-12 | ContactMimic: Humanoid Object Interaction via Contact Control | Xinyao Li, Xialin He, Runpei Dong | arXiv |
| 2026-07-12 | Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups | Jaeho Shin, Maani Ghaffari, Yulun Tian | arXiv |
awesome-vla-study 기반 커리큘럼
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 1 | RT-1: Robotics Transformer — Brohan et al. (2022) | 2212.06817 | First large-scale Robotics Transformer |
| 2 | RT-2: Vision-Language-Action Models — Brohan et al. (2023) | 2307.15818 | VLM backbone → VLA paradigm |
| 3 | Octo — Ghosh et al. (2024) | 2405.12213 | Open-source generalist policy, OXE pretrained |
| 4 | OpenVLA — Kim et al. (2024) | 2406.09246 | First open-source VLM-based VLA |
| 5 | BeT — Shafiullah et al. (2022) | 2206.11251 | Multimodal action discretization |
| 6 | Diffusion Policy — Chi et al. (2023) | 2303.04137 | Diffusion for robot control |
| 7 | ACT/ALOHA — Zhao et al. (2023) | 2304.13705 | Action Chunking Transformer, bimanual |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 8 | CogACT — Li et al. (2024) | 2411.19650 | VLM + DiT action head |
| 9 | GR00T N1 — Bjorck et al. (2025) | 2503.14734 | 2B diffusion transformer, humanoid |
| 10 | X-VLA — Zheng et al. (2025) | 2510.10274 | Cross-embodiment, flow matching |
| 11 | π0 — Black et al. (2024) | 2410.24164 | Flow matching + action expert |
| 12 | InternVLA-M1 — Chen et al. (2025) | 2510.13778 | Spatial grounding → action generation |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 13 | Open X-Embodiment (OXE) — (2023) | 2310.08864 | 1M+ trajectories, 22 embodiments |
| 14 | AgiBot World — Bu et al. (2025) | 2503.06669 | 1M+ trajectories, 217 tasks |
| 15 | UMI — Chi et al. (2024) | 2402.10329 | Robot-free SE(3) data collection |
| 16 | VITRA — Li et al. (2025) | 2510.21571 | Human video → VLA training data |
| 17 | Human to Robot Transfer — Kareer et al. (2025) | 2512.22414 | Human video → robot transfer |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 18 | SmolVLA — Shukor et al. (2025) | 2506.01844 | 450M params, model compression |
| 19 | RTC — Black et al. (2025) | 2506.07339 | Async inference, freezing + inpainting |
| 20 | Helix — Figure AI (2025) | figure.ai/news/helix | Dual-system humanoid |
| 21 | Fast-in-Slow — Chen et al. (2025) | 2506.01953 | End-to-end trainable dual-system |
| # | 논문 | 링크 | 주제 |
|---|---|---|---|
| 22 | HIL-SERL — Luo et al. (2024) | 2410.21845 | Human-in-the-loop RL |
| 23 | SimpleVLA-RL — Li et al. (2025) | 2509.09674 | RL fine-tuning for AR VLA |
| 24 | π*0.6 / Recap — PI (2025) | 2511.14759 | RL for flow-based VLA |
| 25 | CoT-VLA — Zhao et al. (2025) | 2503.22020 | Visual chain-of-thought reasoning |
| 26 | ThinkAct — Huang et al. (2025) | 2507.16815 | Decouple reasoning from execution |
| 27 | Fast-ThinkAct — Huang et al. (2026) | 2601.09708 | Latent distillation, ~10x speed |
| 28 | UniVLA — Wang et al. (2025) | 2506.19850 | Unified AR VLA with world modeling |
| 29 | Cosmos Policy — Kim et al. (2026) | 2601.16163 | Video FM as robot policy backbone |
| 30 | DreamZero — Ye et al. (2026) | dreamzero0.github.io | Joint world+action generation |
137 commits
Python
99.0%