dhkim-furiosa/daily-ai-robotics-papers

Daily AI/Robotics paper briefings (VLA, World Model, Physical AI)

Python

24

137 commits

updated Aug 11, 2026

See the code

README

🤖 Daily AI/Robotics Paper Briefing

VLA, World Model, Physical AI 관련 논문을 매일 자동으로 검색하고 한국어로 요약합니다.

📅 주요 검색 키워드

  • Vision-Language-Action (VLA)
  • World Model for Robotics
  • Physical AI / Embodied AI

🏢 주요 추적 기관/저자

  • 기관: Google, Deepmind, Gemini, Physical Intelligence, Nvidia, Meta, Berkeley, Stanford, World Labs, Advanced Machine Intelligence, Rlwrld
  • 저자: Yann Lecun, Chelsea Finn, Sergey Levine, Moo Jin Kim, Seonghyeon Ye, Fei-Fei Li, Arhan Jain, Abhishek Gupta

🔗 논문 소스

📊 최근 논문 (카테고리별)

VLA

날짜제목저자링크
2026-08-11World Tokens: Enhancing Embodied Policies with Training-Time World ModelingQu Tang, Benhui Zhuang, Bo YuanarXiv
2026-08-10AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action ModelsGuiyu Zhao, Longteng Guo, Yanghong MeiarXiv
2026-08-09PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the CloudChenghua Wang, Daliang Xu, Dongqi CaiarXiv
2026-08-09$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-ManipulationZhe Li, Zhenzhe Zhang, Yangyang WeiarXiv
2026-08-08DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment ManipulationJunfeng Li, Junjie He, Zhide ZhongarXiv
2026-08-08Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic ManipulationHe Kong, Zengjue Chen, Qi WangarXiv
2026-08-08SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied ManipulationChangyuan Wang, Chubin Zhang, Zhenyu WuarXiv
2026-08-06GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAsSuhas Hegde, Jitendra Yasaswi Bharadwaj KattaarXiv
2026-08-06BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D ManipulationPeiyan Li, Yuze Zhu, Yixiang ChenarXiv
2026-08-06Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action ModelsXingyu Ding, Yuzhong Zhao, Yang WuarXiv
2026-08-06Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative InferenceZheng Liu, Zeyu Guo, Zihan LiuarXiv
2026-08-03FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci SamplingLi Lin, Wujun Xu, Weiwei MengarXiv
2026-08-03WCM: A World Critic Model for Vision-Language-Action Reinforcement LearningSenyu Fei, Xiaopeng Yu, Siyin WangarXiv
2026-08-02A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA InferenceZhuoran Song, Haozhe Jiang, Chunyu QiarXiv
2026-08-02Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based PipelineQing Yang, Xun Wang, Ziguan WangarXiv
2026-07-31ACE-Data-0: Human-Centric Ambient Capture as Embodied Data EngineYukang Cao, Haozhe Xie, Beichen WenarXiv
2026-07-30CG-World: A Large-Scale World-State Dataset and Protocol for World ModelsYiming Cai, Fangjie Yu, Meiqing YuarXiv
2026-07-30TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAMHengyi Xie, Chenfei Yao, Xianjin WuarXiv
2026-07-30RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action ModelsDerek Ming Siang Tan, Shailesh Shailesh, Srikrishna IyerarXiv
2026-07-30CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile ManipulationYushan Liu, Peibo Sun, Xintao ChaoarXiv
2026-07-30DLAM: Distributional Latent Actions with Temporal ConstraintsZuojin Tang, Feifan Luo, Haoyun LiuarXiv
2026-07-29CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action ModelMinhyeok Lee, Chiyoung Kim, Chanhoe GuarXiv
2026-07-29SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action ModelsZonghe Liu, Shanyuan Jie, Xiaoquan SunarXiv
2026-07-29A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA ModelsHaoyu Zhang, Yuwei Wu, Jin ChenarXiv
2026-07-28Data Pyramid for Embodied ManipulationYifan Ye, Yankai Fu, Yaoxu LvarXiv
2026-07-28τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual SupervisionNing Cheng, Jinan Xu, Wanlin LiarXiv
2026-07-25AXIS: A Growable Community-Driven Data Engine for Scalable Robot ManipulationMengfei Zhao, Dihong Huang, Yikai TangarXiv
2026-07-24HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous DrivingQuanfu Yu, Xian Wu, Hao XuarXiv
2026-07-24Emergent Compositional Skills in Mixture-of-Experts VLAsShlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali KalidossarXiv
2026-07-23Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail HumanoidsRoger Sala Sisó, Tiago Silvério, Jakob SandarXiv
2026-07-23ReferTrack: Referring Then Tracking for Embodied Visual TrackingHanjing Ye, Tianle Zeng, Jiazhao ZhangarXiv
2026-07-22RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic ManipulationZiqin Wang, Hao Li, Weijun WangarXiv
2026-07-21Patch Policy: Efficient Embodied Control via Dense Visual RepresentationsGaoyue Zhou, Zichen Jeff Cui, Ada LangfordarXiv
2026-07-21PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical ExecutionYang Liu, Weixing Chen, Xinshuai SongarXiv
2026-07-21FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich ManipulationRuicheng Li, Qixiu Li, Ruichun MaarXiv
2026-07-21RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation ModelKehan Li, Bohan Hou, Minghao ZhuarXiv
2026-07-20IMBench: A Benchmark for Intuitive Robotic ManipulationAnurag Maurya, Sukhvansh Jain, Prajwal AvhadarXiv
2026-07-20JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA ModelsHaoran Sun, Wentao Zhang, Junyang HuaarXiv
2026-07-19Video = World + Event StreamLianghua Huang, Zhi-Fan Wu, Yupeng ShiarXiv
2026-07-17CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV TrackingRuilong Ren, Songsheng Cheng, Yunpeng ZhouarXiv
2026-07-17Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic ManipulationYao He, Gan Sun, Wenqi LiangarXiv
2026-07-17RoboTTT: Context Scaling for Robot PoliciesYunfan Jiang, Yevgen Chebotar, Ruijie ZhengarXiv
2026-07-16S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous DrivingJianguo Yu, Rukang Wang, Duanfeng ChuarXiv
2026-07-15TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action BackdoorsPinhan Fu, Xianda Guo, Xuetao LiarXiv
2026-07-15Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous InferenceZebin Yang, Qi Wang, Yunhe WangarXiv
2026-07-15ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuningYilun Kong, Yunpeng Qing, Guozheng MaarXiv
2026-07-14From World Action Models to Embodied Brains: A Roadmap for Open-World Physical IntelligenceYuanzhi Liang, Xufeng Zhan, Haibin HuangarXiv
2026-07-12DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous ManipulationYunchao Yao, Zhuxiu Xu, Tianqi ZhangarXiv

World Model

날짜제목저자링크
2026-08-11WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied ManipulationPeterson Co, Sicheng Hu, Chunxuan JiaoarXiv
2026-08-11Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics ReasoningHaodong Li, Shaoteng Liu, Tianyu WangarXiv
2026-08-11Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion PlanningYapeng Liu, Yuanzhao Zhai, Bo DingarXiv
2026-08-09MASS: Multiplayer World Models with Authoritative Shared StateZiqi Cai, Siqi Yang, Yimu WangarXiv
2026-08-09From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World ModelsJiale Han, Xiang Li, Jing QianarXiv
2026-08-09MiniWorld: Democratizing the Training of Video World Models from ScratchYian Zhao, Ruochong Zheng, Hongcan GuoarXiv
2026-08-08GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual ActionsChenghao Gu, Hanyang Yu, Jingbo ZhangarXiv
2026-08-08XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?Yixiang Chen, Jiabing Yang, Yuan XuarXiv
2026-08-07From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over NetworksChristo Kurisummoottil Thomas, Omar Hashash, Walid SaadarXiv
2026-08-05Self-supervised DXA representations encode multi-system disease risk, biological aging and heritabilityGil Sasson, Zachary Levine, Smadar ShiloarXiv
2026-08-05HP-JEPA: Hierarchical Partitioning for Multi-Resolution Graph Joint-Embedding Predictive LearningRuichen Xu, Jingxiang Qu, Wenhan GaoarXiv
2026-08-03DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture SearchJiayang Niu, Yan Wang, Jie LiarXiv
2026-08-01QQWorld: Quantile-Quantile Matching for World Model RegularizationZhoushun Yu, Xiaoyu Hu, Xiangyu XuarXiv
2026-08-01ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its ShadowJin Cao, Zian Meng, Kaipeng ZhangarXiv
2026-08-01Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3Jens Lehmann, Andrei Aioanei, Sahar VahdatiarXiv
2026-08-01Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and EvaluationFazhong Liu, Zhuoyan Chen, Haozhen TanarXiv
2026-07-31PhiZero: A World Model Built Around Physical LanguageShuyao Shang, Yuqi Wang, Ruopeng GaoarXiv
2026-07-31AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT ScansJingwen Yang, Senmao Wang, Luoyao KangarXiv
2026-07-29INTACT: Isomorphic Intent-to-Action Learning for Search-Free World ModelsJunhan Sun, Hao Zhao, Guofeng ZhangarXiv
2026-07-29Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent GuidanceGaspard Lambrechts, Adrien Bolland, Daniel EbiarXiv
2026-07-27Robot-Factored World Models via Robot RenderingByungjun Kim, Taeksoo Kim, Hyunsoo ChaarXiv
2026-07-27ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot ManipulationYunao Huang, Shiyu Sang, Haotao LuarXiv
2026-07-27Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic UltrasoundSiqi Fan, Mingcong Chen, Ran LiuarXiv
2026-07-27On the Identifiability of Controlled World ModelsXiangteng Zhang, Yang Guan, Bo ZhangarXiv
2026-07-25PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action ExplorationHan Wang, Zijun Wang, Shuoshuo XuearXiv
2026-07-23KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic GroundingZeyu Liu, Zhangzhe Zhu, Yang ZhangarXiv
2026-07-22ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPUFan Jiang, Zhaoxu Sun, Mengchao WangarXiv
2026-07-22Masked Visual Actions for Unified World ModelingHadi Alzayer, Wenlong Huang, Haonan ChenarXiv
2026-07-21Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical IntelligenceRunmao Yao, Kairui Hu, Yukang CaoarXiv
2026-07-18DriftWorld: Fast World Modeling through DriftingSusie Lu, Haonan Chen, Weirui YearXiv
2026-07-18Concept-Guided Spatial Regularization for World Models in Atari PongYukuan Lu, Zaishuo Xia, Weyl LuarXiv
2026-07-18Hierarchical Denoising For Multi-Step Visual ReasoningZezhong Qian, Xiaowei Chi, Chak-Wing MakarXiv
2026-07-16Grounded world models in biological organisms and future embodied AIGiovanni Pezzulo, Davide Nuzzi, Marco D'AlessandroarXiv
2026-07-14Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation ModelXinghang Li, Jun Guo, Qiwei LiarXiv
2026-07-12A Definition and Roadmap for World ModelsXinyuan Chen, Haoyu Guo, Shi GuoarXiv

Physical AI

날짜제목저자링크
2026-08-11RynnValue: Scaling Robotic Value Foundation Models with Temporal DistanceDongchi Huang, Hongyin Zhang, Bohan HouarXiv
2026-08-07IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level MutationZhixiang Chen, Zhuangbin Chen, Ruoxi JiaarXiv
2026-08-07Principles of Robot AutonomyDaniele Gammelli, Joseph Lorenzetti, Katie LuoarXiv
2026-08-03Diagnosing Compositional Generalization in Sequential Robot TasksYixiao Wang, Cheng-En Wu, Lingfeng SunarXiv
2026-08-02From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied IntelligenceJia LuoarXiv
2026-08-02Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness LevelsXinyu Yang, Tianxing Chen, Honghao SuarXiv
2026-08-02Physical AI Governance: From Theory to Practice Across Life CycleWang Yang, Shaobo Wang, Hongxuan LiuarXiv
2026-08-01MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent CooperationDawei Wang, Di Zhao, Xinyuan LiuarXiv
2026-07-31Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied TransferWeiquan Lin, Yu Deng, Shiyang LiuarXiv
2026-07-26TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical ObjectsKe Ma, Yifei Wang, Meng WangarXiv
2026-07-26GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation LearningMasaki Murooka, Ryoichi Nakajo, Keisuke ShiraiarXiv
2026-07-25Clinical Pathways as Safety Specifications for Physical AI in Hospital WardsGabriele Franchini, Giulio Mallardi, Michele De CarolisarXiv
2026-07-18GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AIHuzhenyu Zhang, Shenghai Yuan, Wenrui YanarXiv
2026-07-14Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous VehiclesAshiyana Abdul Majeed, Mahmoud Meribout, Neethu JosepharXiv
2026-07-13Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM InferenceJunfei Zhan, Haoxun Shen, Mingang GuoarXiv
2026-07-12ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AIACE-Brain Team, :, Ziyang GongarXiv

Foundation Model

날짜제목저자링크
2026-08-05Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?Perry Dong, Ron Polonsky, Dorsa SadigharXiv
2026-07-25Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic ManipulationYu Qi, Zhang Ye, Xinyi XuarXiv
2026-07-22Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and EditingXinjie Zhang, Peng Zhang, Shicheng ZhengarXiv
2026-07-19SUFLECA: Scaling Up Feature Learning for CAD-to-image AlignmentSaad Ejaz, Miguel Fernandez-Cortizas, Javier CiveraarXiv
2026-07-17Scaling Behavior Foundation Model for Humanoid RobotsWeishuai Zeng, Kangning Yin, Xiaojie NiuarXiv
2026-07-15Hy-Embodied-VLM-1.0: Efficient Physical-World AgentsZiyi Wang, Xumin Yu, Yongming RaoarXiv
2026-07-15ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation ModelsHaojie Ren, Songrui Luo, Lingfeng WangarXiv
2026-07-13What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-VisibilityFilippo Ziliotto, Luciano Serafini, Lamberto BallanarXiv

Other

날짜제목저자링크
2026-08-10Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical SystemsZhongchao Zhou, Yixuan Xie, Wenwei YuarXiv
2026-08-10Diffusion LLMs as Targets and Adversaries: Mechanistic Safety ExploitsElena Dumitrescu, Gert Lek, Lydia Y. ChenarXiv
2026-08-10RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMsQiyanhui Lu, Han Wu, Rongjian XuarXiv
2026-08-10Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth ObservationJunghwan Park, Sangcheol Sim, Woojin ChoarXiv
2026-08-07QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context DecodingAyushman Garg, Akshita Gupta, Shaswata BhattacharyaarXiv
2026-08-07The Low Frequency Trap: Video Language Models Fail at Simple Event BookkeepingSarvesh Baskar, Zikui Cai, Shayan ShabihiarXiv
2026-08-06AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidanceWayne Wonseok Rodgers, Xiangyi Le, Seonghoon JangarXiv
2026-08-05Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?Filippo Lazzati, Kyle Stachowicz, William ChenarXiv
2026-08-05LieStoNet: Learning Lie Symmetries from Spatiotemporal Data for Stochastic Dynamical SystemsShida Liu, Abhishek Gupta, Sumit SinhaarXiv
2026-08-03Temporal Policy: History-Initialized Action Generation for Robotic Learning from DemonstrationDylan Miller, Martin JagersandarXiv
2026-07-31Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous VehiclesLuca de Martino, Federico Aromolo, Federico NestiarXiv
2026-07-28Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAGMohamed Amine Janati, Laurent Gautier, Stéphane BarbotarXiv
2026-07-28ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical UnderstandingHangjie Yuan, Yichen Qian, Zhiwei TangarXiv
2026-07-28Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats AccumulatingMaruthi Vemula, Neeraj Praneeth GajulaarXiv
2026-07-27Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance AxesMihael Simonič, Xiaocong LiarXiv
2026-07-26Expert Behavior Prior Reinforcement LearningGong Gao, Weidong Zhao, Xianhui LiuarXiv
2026-07-26RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic CraniotomyXiao Zhang, Jiaxuan Li, Renzhen LearXiv
2026-07-26Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory AdjustmentRenzhen Le, Xiao Zhang, Di WuarXiv
2026-07-25Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar LidarSimone Arreghini, Mirko Nava, Nicholas CarlottiarXiv
2026-07-24Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed WindowYukun Shi, Minglun GongarXiv
2026-07-24Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUsMuyang Du, Shuang Yu, Junjie LaiarXiv
2026-07-24Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question AnsweringZikui Cai, Kaushal Janga, Tan Dat DaoarXiv
2026-07-23V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date FruitsShahd Shami, Obadah Wali, Eric FeronarXiv
2026-07-23DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document OperationsJiazhen Jiang, Boxi Cao, Lingyong YanarXiv
2026-07-22NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor FusionSanket SharmaarXiv
2026-07-20Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic ManipulationZhenduo Shang, Xiyao Liu, Bohan LiarXiv
2026-07-20Vision-Language Assistant for Emotional Reactions to Risky DrivingHarine Choi, Eun Hak Lee, Zhengzhong TuarXiv
2026-07-20PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety AssessmentTam Bang, Hussam Abubakr, Emiliano de la Garza VillarrealarXiv
2026-07-19AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent PredictionSeok Joon Kim, Junho Lee, Federica SpinolaarXiv
2026-07-19Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older AdultsAniol Civit, Antonio Andriella, Alba MartínezarXiv
2026-07-19Catch, Throw, Repeat: Planning for Human-Robot Partner JugglingJonathan Rainer Lippert, Kai Ploeger, Abir ChowdhuryarXiv
2026-07-18BadWAM: When World-Action Models Dream Right but Act WrongQi Li, Xingyi Yang, Xinchao WangarXiv
2026-07-17AutoSynthesis: An agentic system for automated meta-analysisMoein Taherinezhad, Sebastian Maier, Gerardo VitaglianoarXiv
2026-07-16Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake EducationXanthi Kokkinou, Chaido Mizeli, Nafsika KoulaxidouarXiv
2026-07-16Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0Wenxiao Wang, Priyatham Kattakinda, Soheil FeiziarXiv
2026-07-16AI-accelerated End-to-End Framework for Rapid Professional UpskillingTam Nguyen, Hung Nguyen, Robert OgburnarXiv
2026-07-14Transformer-Guided Swarm Intelligence for Frugal Neural Architecture SearchRomain AmigonarXiv
2026-07-14DA-Nav: Direction-Aware City-Scale Vision-Language NavigationYe Yuan, Kehan Chen, Xinqiang YuarXiv
2026-07-13VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI AgentsKatherine Swinea, Kshitiz Aryal, Lopamudra PraharajarXiv
2026-07-13Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power NetworksNuocheng Yang, Sihua Wang, Zihan ChenarXiv
2026-07-13Revisiting Euler-Angle Regression with Kolmogorov-Arnold NetworksYangting Sun, Zijun Cui, Yufei ZhangarXiv
2026-07-12ContactMimic: Humanoid Object Interaction via Contact ControlXinyao Li, Xialin He, Runpei DongarXiv
2026-07-12Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie GroupsJaeho Shin, Maani Ghaffari, Yulun TianarXiv

🦾 VLA 스터디 논문 목록

awesome-vla-study 기반 커리큘럼

Phase 2: Early Foundation RFMs & Robot Policy

#논문링크주제
1RT-1: Robotics Transformer — Brohan et al. (2022)2212.06817First large-scale Robotics Transformer
2RT-2: Vision-Language-Action Models — Brohan et al. (2023)2307.15818VLM backbone → VLA paradigm
3Octo — Ghosh et al. (2024)2405.12213Open-source generalist policy, OXE pretrained
4OpenVLA — Kim et al. (2024)2406.09246First open-source VLM-based VLA
5BeT — Shafiullah et al. (2022)2206.11251Multimodal action discretization
6Diffusion Policy — Chi et al. (2023)2303.04137Diffusion for robot control
7ACT/ALOHA — Zhao et al. (2023)2304.13705Action Chunking Transformer, bimanual

Phase 3: Current RFM Architectures

#논문링크주제
8CogACT — Li et al. (2024)2411.19650VLM + DiT action head
9GR00T N1 — Bjorck et al. (2025)2503.147342B diffusion transformer, humanoid
10X-VLA — Zheng et al. (2025)2510.10274Cross-embodiment, flow matching
11π0 — Black et al. (2024)2410.24164Flow matching + action expert
12InternVLA-M1 — Chen et al. (2025)2510.13778Spatial grounding → action generation

Phase 4: Data Scaling

#논문링크주제
13Open X-Embodiment (OXE) — (2023)2310.088641M+ trajectories, 22 embodiments
14AgiBot World — Bu et al. (2025)2503.066691M+ trajectories, 217 tasks
15UMI — Chi et al. (2024)2402.10329Robot-free SE(3) data collection
16VITRA — Li et al. (2025)2510.21571Human video → VLA training data
17Human to Robot Transfer — Kareer et al. (2025)2512.22414Human video → robot transfer

Phase 5: Efficient Inference & Dual-System

#논문링크주제
18SmolVLA — Shukor et al. (2025)2506.01844450M params, model compression
19RTC — Black et al. (2025)2506.07339Async inference, freezing + inpainting
20Helix — Figure AI (2025)figure.ai/news/helixDual-system humanoid
21Fast-in-Slow — Chen et al. (2025)2506.01953End-to-end trainable dual-system

Phase 6: RL Fine-tuning, Reasoning & World Model

#논문링크주제
22HIL-SERL — Luo et al. (2024)2410.21845Human-in-the-loop RL
23SimpleVLA-RL — Li et al. (2025)2509.09674RL fine-tuning for AR VLA
24π*0.6 / Recap — PI (2025)2511.14759RL for flow-based VLA
25CoT-VLA — Zhao et al. (2025)2503.22020Visual chain-of-thought reasoning
26ThinkAct — Huang et al. (2025)2507.16815Decouple reasoning from execution
27Fast-ThinkAct — Huang et al. (2026)2601.09708Latent distillation, ~10x speed
28UniVLA — Wang et al. (2025)2506.19850Unified AR VLA with world modeling
29Cosmos Policy — Kim et al. (2026)2601.16163Video FM as robot policy backbone
30DreamZero — Ye et al. (2026)dreamzero0.github.ioJoint world+action generation

📚 브리핑 아카이브

Contributors

dhkim-furiosa

137 commits

dhkim-furiosa/daily-ai-robotics-papers

Daily AI/Robotics paper briefings (VLA, World Model, Physical AI)

Python

24

137 commits

updated Aug 11, 2026

See the code

README

🤖 Daily AI/Robotics Paper Briefing

VLA, World Model, Physical AI 관련 논문을 매일 자동으로 검색하고 한국어로 요약합니다.

📅 주요 검색 키워드

  • Vision-Language-Action (VLA)
  • World Model for Robotics
  • Physical AI / Embodied AI

🏢 주요 추적 기관/저자

  • 기관: Google, Deepmind, Gemini, Physical Intelligence, Nvidia, Meta, Berkeley, Stanford, World Labs, Advanced Machine Intelligence, Rlwrld
  • 저자: Yann Lecun, Chelsea Finn, Sergey Levine, Moo Jin Kim, Seonghyeon Ye, Fei-Fei Li, Arhan Jain, Abhishek Gupta

🔗 논문 소스

📊 최근 논문 (카테고리별)

VLA

날짜제목저자링크
2026-08-11World Tokens: Enhancing Embodied Policies with Training-Time World ModelingQu Tang, Benhui Zhuang, Bo YuanarXiv
2026-08-10AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action ModelsGuiyu Zhao, Longteng Guo, Yanghong MeiarXiv
2026-08-09PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the CloudChenghua Wang, Daliang Xu, Dongqi CaiarXiv
2026-08-09$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-ManipulationZhe Li, Zhenzhe Zhang, Yangyang WeiarXiv
2026-08-08DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment ManipulationJunfeng Li, Junjie He, Zhide ZhongarXiv
2026-08-08Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic ManipulationHe Kong, Zengjue Chen, Qi WangarXiv
2026-08-08SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied ManipulationChangyuan Wang, Chubin Zhang, Zhenyu WuarXiv
2026-08-06GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAsSuhas Hegde, Jitendra Yasaswi Bharadwaj KattaarXiv
2026-08-06BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D ManipulationPeiyan Li, Yuze Zhu, Yixiang ChenarXiv
2026-08-06Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action ModelsXingyu Ding, Yuzhong Zhao, Yang WuarXiv
2026-08-06Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative InferenceZheng Liu, Zeyu Guo, Zihan LiuarXiv
2026-08-03FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci SamplingLi Lin, Wujun Xu, Weiwei MengarXiv
2026-08-03WCM: A World Critic Model for Vision-Language-Action Reinforcement LearningSenyu Fei, Xiaopeng Yu, Siyin WangarXiv
2026-08-02A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA InferenceZhuoran Song, Haozhe Jiang, Chunyu QiarXiv
2026-08-02Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based PipelineQing Yang, Xun Wang, Ziguan WangarXiv
2026-07-31ACE-Data-0: Human-Centric Ambient Capture as Embodied Data EngineYukang Cao, Haozhe Xie, Beichen WenarXiv
2026-07-30CG-World: A Large-Scale World-State Dataset and Protocol for World ModelsYiming Cai, Fangjie Yu, Meiqing YuarXiv
2026-07-30TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAMHengyi Xie, Chenfei Yao, Xianjin WuarXiv
2026-07-30RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action ModelsDerek Ming Siang Tan, Shailesh Shailesh, Srikrishna IyerarXiv
2026-07-30CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile ManipulationYushan Liu, Peibo Sun, Xintao ChaoarXiv
2026-07-30DLAM: Distributional Latent Actions with Temporal ConstraintsZuojin Tang, Feifan Luo, Haoyun LiuarXiv
2026-07-29CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action ModelMinhyeok Lee, Chiyoung Kim, Chanhoe GuarXiv
2026-07-29SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action ModelsZonghe Liu, Shanyuan Jie, Xiaoquan SunarXiv
2026-07-29A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA ModelsHaoyu Zhang, Yuwei Wu, Jin ChenarXiv
2026-07-28Data Pyramid for Embodied ManipulationYifan Ye, Yankai Fu, Yaoxu LvarXiv
2026-07-28τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual SupervisionNing Cheng, Jinan Xu, Wanlin LiarXiv
2026-07-25AXIS: A Growable Community-Driven Data Engine for Scalable Robot ManipulationMengfei Zhao, Dihong Huang, Yikai TangarXiv
2026-07-24HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous DrivingQuanfu Yu, Xian Wu, Hao XuarXiv
2026-07-24Emergent Compositional Skills in Mixture-of-Experts VLAsShlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali KalidossarXiv
2026-07-23Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail HumanoidsRoger Sala Sisó, Tiago Silvério, Jakob SandarXiv
2026-07-23ReferTrack: Referring Then Tracking for Embodied Visual TrackingHanjing Ye, Tianle Zeng, Jiazhao ZhangarXiv
2026-07-22RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic ManipulationZiqin Wang, Hao Li, Weijun WangarXiv
2026-07-21Patch Policy: Efficient Embodied Control via Dense Visual RepresentationsGaoyue Zhou, Zichen Jeff Cui, Ada LangfordarXiv
2026-07-21PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical ExecutionYang Liu, Weixing Chen, Xinshuai SongarXiv
2026-07-21FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich ManipulationRuicheng Li, Qixiu Li, Ruichun MaarXiv
2026-07-21RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation ModelKehan Li, Bohan Hou, Minghao ZhuarXiv
2026-07-20IMBench: A Benchmark for Intuitive Robotic ManipulationAnurag Maurya, Sukhvansh Jain, Prajwal AvhadarXiv
2026-07-20JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA ModelsHaoran Sun, Wentao Zhang, Junyang HuaarXiv
2026-07-19Video = World + Event StreamLianghua Huang, Zhi-Fan Wu, Yupeng ShiarXiv
2026-07-17CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV TrackingRuilong Ren, Songsheng Cheng, Yunpeng ZhouarXiv
2026-07-17Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic ManipulationYao He, Gan Sun, Wenqi LiangarXiv
2026-07-17RoboTTT: Context Scaling for Robot PoliciesYunfan Jiang, Yevgen Chebotar, Ruijie ZhengarXiv
2026-07-16S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous DrivingJianguo Yu, Rukang Wang, Duanfeng ChuarXiv
2026-07-15TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action BackdoorsPinhan Fu, Xianda Guo, Xuetao LiarXiv
2026-07-15Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous InferenceZebin Yang, Qi Wang, Yunhe WangarXiv
2026-07-15ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuningYilun Kong, Yunpeng Qing, Guozheng MaarXiv
2026-07-14From World Action Models to Embodied Brains: A Roadmap for Open-World Physical IntelligenceYuanzhi Liang, Xufeng Zhan, Haibin HuangarXiv
2026-07-12DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous ManipulationYunchao Yao, Zhuxiu Xu, Tianqi ZhangarXiv

World Model

날짜제목저자링크
2026-08-11WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied ManipulationPeterson Co, Sicheng Hu, Chunxuan JiaoarXiv
2026-08-11Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics ReasoningHaodong Li, Shaoteng Liu, Tianyu WangarXiv
2026-08-11Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion PlanningYapeng Liu, Yuanzhao Zhai, Bo DingarXiv
2026-08-09MASS: Multiplayer World Models with Authoritative Shared StateZiqi Cai, Siqi Yang, Yimu WangarXiv
2026-08-09From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World ModelsJiale Han, Xiang Li, Jing QianarXiv
2026-08-09MiniWorld: Democratizing the Training of Video World Models from ScratchYian Zhao, Ruochong Zheng, Hongcan GuoarXiv
2026-08-08GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual ActionsChenghao Gu, Hanyang Yu, Jingbo ZhangarXiv
2026-08-08XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?Yixiang Chen, Jiabing Yang, Yuan XuarXiv
2026-08-07From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over NetworksChristo Kurisummoottil Thomas, Omar Hashash, Walid SaadarXiv
2026-08-05Self-supervised DXA representations encode multi-system disease risk, biological aging and heritabilityGil Sasson, Zachary Levine, Smadar ShiloarXiv
2026-08-05HP-JEPA: Hierarchical Partitioning for Multi-Resolution Graph Joint-Embedding Predictive LearningRuichen Xu, Jingxiang Qu, Wenhan GaoarXiv
2026-08-03DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture SearchJiayang Niu, Yan Wang, Jie LiarXiv
2026-08-01QQWorld: Quantile-Quantile Matching for World Model RegularizationZhoushun Yu, Xiaoyu Hu, Xiangyu XuarXiv
2026-08-01ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its ShadowJin Cao, Zian Meng, Kaipeng ZhangarXiv
2026-08-01Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3Jens Lehmann, Andrei Aioanei, Sahar VahdatiarXiv
2026-08-01Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and EvaluationFazhong Liu, Zhuoyan Chen, Haozhen TanarXiv
2026-07-31PhiZero: A World Model Built Around Physical LanguageShuyao Shang, Yuqi Wang, Ruopeng GaoarXiv
2026-07-31AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT ScansJingwen Yang, Senmao Wang, Luoyao KangarXiv
2026-07-29INTACT: Isomorphic Intent-to-Action Learning for Search-Free World ModelsJunhan Sun, Hao Zhao, Guofeng ZhangarXiv
2026-07-29Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent GuidanceGaspard Lambrechts, Adrien Bolland, Daniel EbiarXiv
2026-07-27Robot-Factored World Models via Robot RenderingByungjun Kim, Taeksoo Kim, Hyunsoo ChaarXiv
2026-07-27ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot ManipulationYunao Huang, Shiyu Sang, Haotao LuarXiv
2026-07-27Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic UltrasoundSiqi Fan, Mingcong Chen, Ran LiuarXiv
2026-07-27On the Identifiability of Controlled World ModelsXiangteng Zhang, Yang Guan, Bo ZhangarXiv
2026-07-25PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action ExplorationHan Wang, Zijun Wang, Shuoshuo XuearXiv
2026-07-23KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic GroundingZeyu Liu, Zhangzhe Zhu, Yang ZhangarXiv
2026-07-22ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPUFan Jiang, Zhaoxu Sun, Mengchao WangarXiv
2026-07-22Masked Visual Actions for Unified World ModelingHadi Alzayer, Wenlong Huang, Haonan ChenarXiv
2026-07-21Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical IntelligenceRunmao Yao, Kairui Hu, Yukang CaoarXiv
2026-07-18DriftWorld: Fast World Modeling through DriftingSusie Lu, Haonan Chen, Weirui YearXiv
2026-07-18Concept-Guided Spatial Regularization for World Models in Atari PongYukuan Lu, Zaishuo Xia, Weyl LuarXiv
2026-07-18Hierarchical Denoising For Multi-Step Visual ReasoningZezhong Qian, Xiaowei Chi, Chak-Wing MakarXiv
2026-07-16Grounded world models in biological organisms and future embodied AIGiovanni Pezzulo, Davide Nuzzi, Marco D'AlessandroarXiv
2026-07-14Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation ModelXinghang Li, Jun Guo, Qiwei LiarXiv
2026-07-12A Definition and Roadmap for World ModelsXinyuan Chen, Haoyu Guo, Shi GuoarXiv

Physical AI

날짜제목저자링크
2026-08-11RynnValue: Scaling Robotic Value Foundation Models with Temporal DistanceDongchi Huang, Hongyin Zhang, Bohan HouarXiv
2026-08-07IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level MutationZhixiang Chen, Zhuangbin Chen, Ruoxi JiaarXiv
2026-08-07Principles of Robot AutonomyDaniele Gammelli, Joseph Lorenzetti, Katie LuoarXiv
2026-08-03Diagnosing Compositional Generalization in Sequential Robot TasksYixiao Wang, Cheng-En Wu, Lingfeng SunarXiv
2026-08-02From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied IntelligenceJia LuoarXiv
2026-08-02Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness LevelsXinyu Yang, Tianxing Chen, Honghao SuarXiv
2026-08-02Physical AI Governance: From Theory to Practice Across Life CycleWang Yang, Shaobo Wang, Hongxuan LiuarXiv
2026-08-01MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent CooperationDawei Wang, Di Zhao, Xinyuan LiuarXiv
2026-07-31Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied TransferWeiquan Lin, Yu Deng, Shiyang LiuarXiv
2026-07-26TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical ObjectsKe Ma, Yifei Wang, Meng WangarXiv
2026-07-26GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation LearningMasaki Murooka, Ryoichi Nakajo, Keisuke ShiraiarXiv
2026-07-25Clinical Pathways as Safety Specifications for Physical AI in Hospital WardsGabriele Franchini, Giulio Mallardi, Michele De CarolisarXiv
2026-07-18GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AIHuzhenyu Zhang, Shenghai Yuan, Wenrui YanarXiv
2026-07-14Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous VehiclesAshiyana Abdul Majeed, Mahmoud Meribout, Neethu JosepharXiv
2026-07-13Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM InferenceJunfei Zhan, Haoxun Shen, Mingang GuoarXiv
2026-07-12ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AIACE-Brain Team, :, Ziyang GongarXiv

Foundation Model

날짜제목저자링크
2026-08-05Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?Perry Dong, Ron Polonsky, Dorsa SadigharXiv
2026-07-25Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic ManipulationYu Qi, Zhang Ye, Xinyi XuarXiv
2026-07-22Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and EditingXinjie Zhang, Peng Zhang, Shicheng ZhengarXiv
2026-07-19SUFLECA: Scaling Up Feature Learning for CAD-to-image AlignmentSaad Ejaz, Miguel Fernandez-Cortizas, Javier CiveraarXiv
2026-07-17Scaling Behavior Foundation Model for Humanoid RobotsWeishuai Zeng, Kangning Yin, Xiaojie NiuarXiv
2026-07-15Hy-Embodied-VLM-1.0: Efficient Physical-World AgentsZiyi Wang, Xumin Yu, Yongming RaoarXiv
2026-07-15ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation ModelsHaojie Ren, Songrui Luo, Lingfeng WangarXiv
2026-07-13What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-VisibilityFilippo Ziliotto, Luciano Serafini, Lamberto BallanarXiv

Other

날짜제목저자링크
2026-08-10Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical SystemsZhongchao Zhou, Yixuan Xie, Wenwei YuarXiv
2026-08-10Diffusion LLMs as Targets and Adversaries: Mechanistic Safety ExploitsElena Dumitrescu, Gert Lek, Lydia Y. ChenarXiv
2026-08-10RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMsQiyanhui Lu, Han Wu, Rongjian XuarXiv
2026-08-10Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth ObservationJunghwan Park, Sangcheol Sim, Woojin ChoarXiv
2026-08-07QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context DecodingAyushman Garg, Akshita Gupta, Shaswata BhattacharyaarXiv
2026-08-07The Low Frequency Trap: Video Language Models Fail at Simple Event BookkeepingSarvesh Baskar, Zikui Cai, Shayan ShabihiarXiv
2026-08-06AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidanceWayne Wonseok Rodgers, Xiangyi Le, Seonghoon JangarXiv
2026-08-05Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?Filippo Lazzati, Kyle Stachowicz, William ChenarXiv
2026-08-05LieStoNet: Learning Lie Symmetries from Spatiotemporal Data for Stochastic Dynamical SystemsShida Liu, Abhishek Gupta, Sumit SinhaarXiv
2026-08-03Temporal Policy: History-Initialized Action Generation for Robotic Learning from DemonstrationDylan Miller, Martin JagersandarXiv
2026-07-31Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous VehiclesLuca de Martino, Federico Aromolo, Federico NestiarXiv
2026-07-28Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAGMohamed Amine Janati, Laurent Gautier, Stéphane BarbotarXiv
2026-07-28ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical UnderstandingHangjie Yuan, Yichen Qian, Zhiwei TangarXiv
2026-07-28Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats AccumulatingMaruthi Vemula, Neeraj Praneeth GajulaarXiv
2026-07-27Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance AxesMihael Simonič, Xiaocong LiarXiv
2026-07-26Expert Behavior Prior Reinforcement LearningGong Gao, Weidong Zhao, Xianhui LiuarXiv
2026-07-26RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic CraniotomyXiao Zhang, Jiaxuan Li, Renzhen LearXiv
2026-07-26Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory AdjustmentRenzhen Le, Xiao Zhang, Di WuarXiv
2026-07-25Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar LidarSimone Arreghini, Mirko Nava, Nicholas CarlottiarXiv
2026-07-24Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed WindowYukun Shi, Minglun GongarXiv
2026-07-24Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUsMuyang Du, Shuang Yu, Junjie LaiarXiv
2026-07-24Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question AnsweringZikui Cai, Kaushal Janga, Tan Dat DaoarXiv
2026-07-23V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date FruitsShahd Shami, Obadah Wali, Eric FeronarXiv
2026-07-23DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document OperationsJiazhen Jiang, Boxi Cao, Lingyong YanarXiv
2026-07-22NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor FusionSanket SharmaarXiv
2026-07-20Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic ManipulationZhenduo Shang, Xiyao Liu, Bohan LiarXiv
2026-07-20Vision-Language Assistant for Emotional Reactions to Risky DrivingHarine Choi, Eun Hak Lee, Zhengzhong TuarXiv
2026-07-20PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety AssessmentTam Bang, Hussam Abubakr, Emiliano de la Garza VillarrealarXiv
2026-07-19AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent PredictionSeok Joon Kim, Junho Lee, Federica SpinolaarXiv
2026-07-19Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older AdultsAniol Civit, Antonio Andriella, Alba MartínezarXiv
2026-07-19Catch, Throw, Repeat: Planning for Human-Robot Partner JugglingJonathan Rainer Lippert, Kai Ploeger, Abir ChowdhuryarXiv
2026-07-18BadWAM: When World-Action Models Dream Right but Act WrongQi Li, Xingyi Yang, Xinchao WangarXiv
2026-07-17AutoSynthesis: An agentic system for automated meta-analysisMoein Taherinezhad, Sebastian Maier, Gerardo VitaglianoarXiv
2026-07-16Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake EducationXanthi Kokkinou, Chaido Mizeli, Nafsika KoulaxidouarXiv
2026-07-16Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0Wenxiao Wang, Priyatham Kattakinda, Soheil FeiziarXiv
2026-07-16AI-accelerated End-to-End Framework for Rapid Professional UpskillingTam Nguyen, Hung Nguyen, Robert OgburnarXiv
2026-07-14Transformer-Guided Swarm Intelligence for Frugal Neural Architecture SearchRomain AmigonarXiv
2026-07-14DA-Nav: Direction-Aware City-Scale Vision-Language NavigationYe Yuan, Kehan Chen, Xinqiang YuarXiv
2026-07-13VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI AgentsKatherine Swinea, Kshitiz Aryal, Lopamudra PraharajarXiv
2026-07-13Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power NetworksNuocheng Yang, Sihua Wang, Zihan ChenarXiv
2026-07-13Revisiting Euler-Angle Regression with Kolmogorov-Arnold NetworksYangting Sun, Zijun Cui, Yufei ZhangarXiv
2026-07-12ContactMimic: Humanoid Object Interaction via Contact ControlXinyao Li, Xialin He, Runpei DongarXiv
2026-07-12Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie GroupsJaeho Shin, Maani Ghaffari, Yulun TianarXiv

🦾 VLA 스터디 논문 목록

awesome-vla-study 기반 커리큘럼

Phase 2: Early Foundation RFMs & Robot Policy

#논문링크주제
1RT-1: Robotics Transformer — Brohan et al. (2022)2212.06817First large-scale Robotics Transformer
2RT-2: Vision-Language-Action Models — Brohan et al. (2023)2307.15818VLM backbone → VLA paradigm
3Octo — Ghosh et al. (2024)2405.12213Open-source generalist policy, OXE pretrained
4OpenVLA — Kim et al. (2024)2406.09246First open-source VLM-based VLA
5BeT — Shafiullah et al. (2022)2206.11251Multimodal action discretization
6Diffusion Policy — Chi et al. (2023)2303.04137Diffusion for robot control
7ACT/ALOHA — Zhao et al. (2023)2304.13705Action Chunking Transformer, bimanual

Phase 3: Current RFM Architectures

#논문링크주제
8CogACT — Li et al. (2024)2411.19650VLM + DiT action head
9GR00T N1 — Bjorck et al. (2025)2503.147342B diffusion transformer, humanoid
10X-VLA — Zheng et al. (2025)2510.10274Cross-embodiment, flow matching
11π0 — Black et al. (2024)2410.24164Flow matching + action expert
12InternVLA-M1 — Chen et al. (2025)2510.13778Spatial grounding → action generation

Phase 4: Data Scaling

#논문링크주제
13Open X-Embodiment (OXE) — (2023)2310.088641M+ trajectories, 22 embodiments
14AgiBot World — Bu et al. (2025)2503.066691M+ trajectories, 217 tasks
15UMI — Chi et al. (2024)2402.10329Robot-free SE(3) data collection
16VITRA — Li et al. (2025)2510.21571Human video → VLA training data
17Human to Robot Transfer — Kareer et al. (2025)2512.22414Human video → robot transfer

Phase 5: Efficient Inference & Dual-System

#논문링크주제
18SmolVLA — Shukor et al. (2025)2506.01844450M params, model compression
19RTC — Black et al. (2025)2506.07339Async inference, freezing + inpainting
20Helix — Figure AI (2025)figure.ai/news/helixDual-system humanoid
21Fast-in-Slow — Chen et al. (2025)2506.01953End-to-end trainable dual-system

Phase 6: RL Fine-tuning, Reasoning & World Model

#논문링크주제
22HIL-SERL — Luo et al. (2024)2410.21845Human-in-the-loop RL
23SimpleVLA-RL — Li et al. (2025)2509.09674RL fine-tuning for AR VLA
24π*0.6 / Recap — PI (2025)2511.14759RL for flow-based VLA
25CoT-VLA — Zhao et al. (2025)2503.22020Visual chain-of-thought reasoning
26ThinkAct — Huang et al. (2025)2507.16815Decouple reasoning from execution
27Fast-ThinkAct — Huang et al. (2026)2601.09708Latent distillation, ~10x speed
28UniVLA — Wang et al. (2025)2506.19850Unified AR VLA with world modeling
29Cosmos Policy — Kim et al. (2026)2601.16163Video FM as robot policy backbone
30DreamZero — Ye et al. (2026)dreamzero0.github.ioJoint world+action generation

📚 브리핑 아카이브

Contributors

dhkim-furiosa

137 commits

Languages

Python

99.0%