🧠 Awesome Memory-VLA: A curated list of Visual-Language-Action models with memory
138
21 commits
updated Sep 28, 2026
This is a collection of research papers for Visual-Language-Action (VLA) models and World Action Models (WAM) with memory, designed to solve long-horizon, partially observabe tasks. The repository shall be regularly updated to track the frontiers. As there is no generally accepted definition of memory in the context of VLA, we include all works related to the ability of VLA systems to process information over horizons longer than a single step.
This list is curated by a human, with each entry verified by reading the actual content of the papers — not compiled by agents.
Keywords: memory · key frame selection · long-horizon · partial observability · POMDP · long context
Contributions are welcome. Submit a PR with relevant papers or resources you consider significant.
format:
- [title](paper link)
- author1, author2, and author3...
MIKASA-Robo-VLA: Benchmarking Memory in VLA Models for Long-Horizon Manipulation
μVLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models
SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models
AdaHVLA: Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution
MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
Zeva-Ego: Egocentric Mid-Training with In-Context Causal Learning for Robot Manipulation
TEMPO: Learning Temporal Context for Dynamic Robot Manipulation
Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
MessyMem: Learning-from-Doing Memory for Mobile Manipulation
UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling
Memory as Plans: World-Action Modeling with Memory-Grounded Planning
MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation
Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models
$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation
SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation
Analytic Concept-Centric Memory for Agentic Embodied Manipulation
DIM-WAM: World-Action Modeling with Diverse Historical Event Memory
World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays
KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies
MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation
Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation
Reflective VLA: In-Context Action Consequences Make VLAs Generalize
S^2-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models
WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation
TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation
AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model
HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation
Action-Effect Memory Pretraining for Robot Manipulation
AURA: Action-Gated Memory for Robot Policies at Constant VRAM
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
Long-Term Memory for VLA-based Agents in Open-World Task Execution
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
Chameleon: Episodic Memory for Long-Horizon Robotic Manipulation
Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks
PhysMem: Scaling Test-time Physical Memory for Robot Manipulation
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies
Benchmarking Robot Memory Under Interference
RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning
RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation
Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks
BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames
Recursive Belief Vision Language Action Models
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
143 followers · starred Jul 2026
🧠 Awesome Memory-VLA: A curated list of Visual-Language-Action models with memory
138
21 commits
updated Sep 28, 2026
This is a collection of research papers for Visual-Language-Action (VLA) models and World Action Models (WAM) with memory, designed to solve long-horizon, partially observabe tasks. The repository shall be regularly updated to track the frontiers. As there is no generally accepted definition of memory in the context of VLA, we include all works related to the ability of VLA systems to process information over horizons longer than a single step.
This list is curated by a human, with each entry verified by reading the actual content of the papers — not compiled by agents.
Keywords: memory · key frame selection · long-horizon · partial observability · POMDP · long context
Contributions are welcome. Submit a PR with relevant papers or resources you consider significant.
format:
- [title](paper link)
- author1, author2, and author3...
MIKASA-Robo-VLA: Benchmarking Memory in VLA Models for Long-Horizon Manipulation
μVLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models
SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models
AdaHVLA: Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution
MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
Zeva-Ego: Egocentric Mid-Training with In-Context Causal Learning for Robot Manipulation
TEMPO: Learning Temporal Context for Dynamic Robot Manipulation
Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
MessyMem: Learning-from-Doing Memory for Mobile Manipulation
UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling
Memory as Plans: World-Action Modeling with Memory-Grounded Planning
MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation
Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models
$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation
SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation
Analytic Concept-Centric Memory for Agentic Embodied Manipulation
DIM-WAM: World-Action Modeling with Diverse Historical Event Memory
World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays
KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies
MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation
Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation
Reflective VLA: In-Context Action Consequences Make VLAs Generalize
S^2-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models
WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation
TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation
AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model
HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation
Action-Effect Memory Pretraining for Robot Manipulation
AURA: Action-Gated Memory for Robot Policies at Constant VRAM
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
Long-Term Memory for VLA-based Agents in Open-World Task Execution
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
Chameleon: Episodic Memory for Long-Horizon Robotic Manipulation
Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks
PhysMem: Scaling Test-time Physical Memory for Robot Manipulation
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies
Benchmarking Robot Memory Under Interference
RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning
RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation
Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks
BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames
Recursive Belief Vision Language Action Models
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
143 followers · starred Jul 2026