A paper list of some recent works about Token Compress for Vit and VLM
957
174 commits
updated Sep 24, 2026
🔥🔥🔥 A paper list of some recent works about Token Compress for Vit and VLM.
VPRUNE: EFFICIENT TRAINING-FREE PRE-LLM VISUAL TOKEN PRUNING. [VPRune;]
CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs. [CoVeR;GitHub]
Who Speaks for the Pruned?
Visual Token Pruning as Coverage Optimization. [CoverPruner;]
Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models. [TBD;Video;Distillation]
Visual Token Coding for Video Multimodal Large Language Models. [VTC;Video;GitHub]
Aggregating Visual Information with Optimal Transport for VideoLM Token
Compression. [AVIOT;Video;GitHub]
An AI4AI Framework for Visual Token Pruning. [AutoPrune;]
Semantic-Guided Slow-Fast Pruning of Visual Tokens for Vision-Language Models. [ICASSP 2026]
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering. [3DZip;3D;ECCV 2026;GitHub]
Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models. [ALTR;]
VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression. [VisCo;ACM MM 2026;GitHub]
GeoTrace: Geometry-Aware Trajectory Token
Compression for Video Large Language Models. [GeoTrace;Video;]
AnchorPrune: Relevance-Anchored Contextual
Expansion for Visual Token Pruning. [AnchorPrune;ECCV 2026;GitHub]
Combating Textual Noise and Redundancy:Entropy-Aware Dense Visual Token Pruning. [EADP;ECCV 2026;GitHub]
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models. [CLSE;ECCV 2026;GitHub]
One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs.[ALVTS;CVPR 2026]
MeToM: Metadata-Guided Token Merging for Efficient Video LLMs. [MeToM;Video;CVPR 2026]
InfoMerge: Information-aware Token Compression for Efficient Video
Large Language Models. [InfoMerge; ]
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for
Efficient Large Vision-Language Models. [EvoCut; ]
RESTORE: Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference. [RESTORE; ICML 2026; GitHub]
EarlyTom:Early Token Compression Completes Fast Video Understanding. [EarlyTom;Video;CVPR 2026;GitHub]
OccamToken: Efficient VLM Inference with
Training-Free and Budget-Adaptive Token Pruning. [OccamToken; ]
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding. [ST-GridPool;Video;ICLR 2026;GitHub]
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs.[DynaTok;]
OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models. [OmniRefine;]
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models. [OTT-Vid;GitHub]
EVADING VISUAL APHASIA: CONTRASTIVE ADAPTIVE SEMANTIC TOKEN PRUNING FOR VISION-LANGUAGE MODELS. [COAST;]
Decoupled Similarity for Task-Aware Token Pruning
in Large Vision-Language Models. [DeSAP;]
KiToke: Kernel-based Interval-aware Token Compression
for Video Large Language Models. [KiToke;]
Hierarchical Pre-Training of Vision Encoders with Large Language Models. [HIVE;CVPR 2026 Workshop;GitHub]
Learning to Select Visual In-Context Demonstrations. [LSD;CVPR 2026 Findings;GitHub]
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning. [SCORE;Video;RL]
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling. [ForestPrune;GitHub]
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention. [Video;CVPR 2026]
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference. [ASAP;]
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models. [TPRL;GitHub]
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity. [PruneSID;ICLR 2026;GitHub]
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models. [AgilePruner;ICLR 2026;GitHub]
Token Reduction via Local and Global Contexts Optimization for Efficient Video
Large Language Models. [AOT;GitHub]
ApET: Approximation-Error Guided Token Compression for Efficient VLMs. [ApET;GitHub]
DUET-VLM: Dual-Stage Efficient Token Reduction for Vision-Language Models. [DUET-VLM;GitHub]
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal
Large Language Models. [EntropyPrune;GitHub]
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging. [FlashVID; ICLR 2026; GitHub]
Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning. [FSR;GitHub]
Contribution-aware Token Compression for Efficient Video Understanding via
Reinforcement Learning. [CaCoVID;]
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration. [VisionTrim;ICLR 2026;GitHub]
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models. [FlashVLM;]
Focus: A Streaming Concentration Architecture for
Efficient Vision-Language Models. [Focus; GitHub]
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs. [EchoingPixels; Audio-Video]
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models. [HTC-VLM;]
Less Is More, but Where? Dynamic Token Compression via LLM-Guided
Keyframe Prior. [DyToK; GitHub]
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs. [LLaVA-UHD v3;]
FloC: FACILITY LOCATION-BASED EFFICIENT VI- SUAL TOKEN COMPRESSION FOR LONG VIDEO UN- DERSTANDING. [FloC;]
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models.[Visual Token Compression Benchmark]
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs. [VisionSelector; GitHub]
AutoPrune: Each Complexity Deserves a Pruning Policy. [AutoPrune;NIPS2025; GitHub]
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression. [LightVLM;]
MMG-Vid: Maximizing Marginal Gains at Segment-level
and Token-level for Efficient Video LLMs. [MMG-Vid;]
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference. [VISA; GitHub]
HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models. [HiPrune; GitHub]
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models. [GlimpsePrune; GitHub]
Short-LVLM: Compressing and Accelerating Large
Vision-Language Models by Pruning Redundant Layers. [Short-LVLM; GitHub]
When Tokens Talk Too Much: A Survey of
Multimodal Long-Context Token Compression across Images, Videos, and Audios. [Survey ;GitHub]
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning. [VisionThink; GitHub]
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs. [STTM;ICCV; GitHub]
Beyond Token Pruning: Operation Pruning in Vision-Language Models. [GSOP; GitHub]
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models. [LaCo;]
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs. [LLaVA-Scissor;Video; GitHub]
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models. [GreedyPrune;]
Learning Compact Vision Tokens for Efficient Large Multimodal Models. [LLaVA-STF;VQA; GitHub]
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding. [DynTok; Video;]
HoliTom: Holistic Token Merging for Fast Video Large Language Models. [HoliTom; Video; GitHub]
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models. [AdaTP; Video;]
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms. [CrossLMM; Video; GitHub]
Clapper: Compact Learning and Video Representation in VLMs. [Clapper; Video]
Video Compression Commander:Plug-and-Play Inference Acceleration for Video Large Language Models. [VidCom2; Video; GitHub]
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning. [LLaVA-Meteor]
Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering. [Explore-Then-Select; Video; EMNLP 2025; GitHub]
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding. [FiLA-Video;Video]
VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning. [VCM]
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos. [TimeChat-Online; Video; GitHub]
DYMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs. [DYMU;GitHub]
Quicksviewer: An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes. [Quicksviewer;Video;GitHub]
PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models. [PACT;CVPR 2025;GitHub]
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA. [QG-VTC;VQA]
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model. [TopV; CVPR 2025]
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression. [InternVL-X;GitHub]
Token Dynamics: Towards Efficient and Dynamic Video Token Representation for Video Large Language Model. [Token Dynamics;Video]
HICom:Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models. [HICom;2025 CVPR;Video;GitHub]
TwigVLM: Growing a Twig to Accelerate Large Vision-Language Models. [TwigVLM; ICCV 2025;GitHub]
FastVID: Dynamic Density Pruning for Fast Video Large Language Models. [FastVID;GitHub]
SAINT:Similarity-Aware Token Pruning: Your VLM but Faster. [SAINT;GitHub]
STORM:Token-Efficient Long Video Understanding for Multimodal LLMs. [STORM;Video;NVIDIA]
OpenReview Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification. [Dynamic-LLaVA; ICLR2025; GitHub]
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models. [DivPrune;GitHub]
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression. [FCoT-VL;]
Beyond Token Compression: A Training-Free Reduction Framework for Efficient Visual Processing in MLLMs. [Beyond Token Compression;GitHub]
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers. [Falcon; ICCV 2025; GitHub]
DyRate:Dynamic Token Reduction during Generation for Vision Language Models. [DyRate]
AdaFV: Accelerating VLMs with Self-Adaptive Cross-Modality Attention Mixture. [AdaFV]
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token. [LLAVA-MINI;GitHub]
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models. [FrameFusion;Video;GitHub]
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling. [VideoChat-Flash;Video;GitHub]
RETAKE: Reducing Temporal and Knowledge Redundancy for Long Video Understanding. [RETAKE;Video;GitHub]
FastVLM: Efficient Vision Encoding for Vision Language Models. [FastVLM;Apple;]
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models. [PVC;Video;GitHub]
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM. [Dynamic-VLM;Video;]
VisionZip: Longer is Better but Not Necessary in Vision Language Models. [VisionZip;Video;GitHub]
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay. [p-MoD: GitHub]
[CLS] Attention is All You Need for Training-Free Visual Token Pruning: Make VLM Inference Faster. [FasterVLM: GitHub]
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models. [ATP-LLaVA]
OpenReview LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token. [LLaVA-Mini]
Rethinking Token Reduction in MLLMs: Towards a Unified Paradigm for Training-Free Acceleration .[FiCoCo;]
OpenReview LVP: Language-guide Visual Projector for Efficient Multimodal LLM.[LVP]
OpenReview Efficient Multi-modal Large Language Models via Visual Token Grouping .[VisToG]
DyCoke:Dynamic Compression of Tokens for Fast Video Large Language Models .[DyCoke;Video;Github]
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression .[FocusLLaVA;]
MustDrop:Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model .[MustDrop;Github]
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization .[RLT;Video;NeurIPS 2024;Github]
Inference Optimal VLMs Need Only One Visual Token but Larger Models .[QueCC;Github]
Video Token Merging for Long-form Video Understandin .[Learnable VTM;Video]
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding .[LongVU;Video;Github]
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction .[PyramidDrop;Github]
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers .[Victor;]
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models .[VidCompress;]
Retrieval Replace Reduction:An effective visual token reduction method via semantic match .[TRSM;]
AVG-LLaVA: A Large Multimodal Model with Adaptive Visual Granularity .[AVG-LLaVA;Github]
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs .[TRIM]
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Consideration .[TC-LLaVA;Video;]
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings .[TG-LLaVA]
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding . [mPLUG-DocOwl2;Github]
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval . [TempMe;Video;ICLR 2025;Github]
Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information . [Recoverable Compression]
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models in Resource-Constrained Environments . [HiRED;Github]
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models. [mPLUG-Owl3;Github]
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding . [Token-level;Github]
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models . [HiRes-LLaVA;]
TokenPacker: Efficient Visual Projector for Multimodal LLM . [TokenPacker;Github]
VoCo-LLaMA: Towards Vision Compression with Large Language Models . [VoCo-LLaMA;Github]
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models . [DeCo;Github]
Matryoshka Query Transformer for Large Vision-Language Models . [MQT-LLaVA; NeurIPS 2024]Github]
Matryoshka Multimodal Models . [Matryoshka;M3]Github]
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites . [InternVL;Pixel-Shuffle;Github]
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference . [CATP;]
LLaVA-PruMerge:
Adaptive Token Reduction for Efficient Large Multimodal Models . [LLaVA-PruMerge;Github]
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-PLay Acceleration for VLLM Inference . [FastV;ECCV 2024;Github]
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model . [LDP-v2;Github]
When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression . [PtM;Github]
Video Patch Pruning: Efficient Video Instance Segmentation via Early Token
Reduction . [VPP;Github]
ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT . [ToaSt]
Lossless Token Merging Even Without Fine-Tuning in Vision Transformers . [ATM]
Prune and Merge: Efficient Token Compression For Vision Transformer With Spatial Information Preserved . [Prune and Merge;Github]
A paper list of some recent works about Token Compress for Vit and VLM
957
174 commits
updated Sep 24, 2026
🔥🔥🔥 A paper list of some recent works about Token Compress for Vit and VLM.
VPRUNE: EFFICIENT TRAINING-FREE PRE-LLM VISUAL TOKEN PRUNING. [VPRune;]
CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs. [CoVeR;GitHub]
Who Speaks for the Pruned?
Visual Token Pruning as Coverage Optimization. [CoverPruner;]
Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models. [TBD;Video;Distillation]
Visual Token Coding for Video Multimodal Large Language Models. [VTC;Video;GitHub]
Aggregating Visual Information with Optimal Transport for VideoLM Token
Compression. [AVIOT;Video;GitHub]
An AI4AI Framework for Visual Token Pruning. [AutoPrune;]
Semantic-Guided Slow-Fast Pruning of Visual Tokens for Vision-Language Models. [ICASSP 2026]
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering. [3DZip;3D;ECCV 2026;GitHub]
Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models. [ALTR;]
VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression. [VisCo;ACM MM 2026;GitHub]
GeoTrace: Geometry-Aware Trajectory Token
Compression for Video Large Language Models. [GeoTrace;Video;]
AnchorPrune: Relevance-Anchored Contextual
Expansion for Visual Token Pruning. [AnchorPrune;ECCV 2026;GitHub]
Combating Textual Noise and Redundancy:Entropy-Aware Dense Visual Token Pruning. [EADP;ECCV 2026;GitHub]
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models. [CLSE;ECCV 2026;GitHub]
One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs.[ALVTS;CVPR 2026]
MeToM: Metadata-Guided Token Merging for Efficient Video LLMs. [MeToM;Video;CVPR 2026]
InfoMerge: Information-aware Token Compression for Efficient Video
Large Language Models. [InfoMerge; ]
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for
Efficient Large Vision-Language Models. [EvoCut; ]
RESTORE: Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference. [RESTORE; ICML 2026; GitHub]
EarlyTom:Early Token Compression Completes Fast Video Understanding. [EarlyTom;Video;CVPR 2026;GitHub]
OccamToken: Efficient VLM Inference with
Training-Free and Budget-Adaptive Token Pruning. [OccamToken; ]
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding. [ST-GridPool;Video;ICLR 2026;GitHub]
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs.[DynaTok;]
OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models. [OmniRefine;]
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models. [OTT-Vid;GitHub]
EVADING VISUAL APHASIA: CONTRASTIVE ADAPTIVE SEMANTIC TOKEN PRUNING FOR VISION-LANGUAGE MODELS. [COAST;]
Decoupled Similarity for Task-Aware Token Pruning
in Large Vision-Language Models. [DeSAP;]
KiToke: Kernel-based Interval-aware Token Compression
for Video Large Language Models. [KiToke;]
Hierarchical Pre-Training of Vision Encoders with Large Language Models. [HIVE;CVPR 2026 Workshop;GitHub]
Learning to Select Visual In-Context Demonstrations. [LSD;CVPR 2026 Findings;GitHub]
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning. [SCORE;Video;RL]
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling. [ForestPrune;GitHub]
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention. [Video;CVPR 2026]
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference. [ASAP;]
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models. [TPRL;GitHub]
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity. [PruneSID;ICLR 2026;GitHub]
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models. [AgilePruner;ICLR 2026;GitHub]
Token Reduction via Local and Global Contexts Optimization for Efficient Video
Large Language Models. [AOT;GitHub]
ApET: Approximation-Error Guided Token Compression for Efficient VLMs. [ApET;GitHub]
DUET-VLM: Dual-Stage Efficient Token Reduction for Vision-Language Models. [DUET-VLM;GitHub]
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal
Large Language Models. [EntropyPrune;GitHub]
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging. [FlashVID; ICLR 2026; GitHub]
Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning. [FSR;GitHub]
Contribution-aware Token Compression for Efficient Video Understanding via
Reinforcement Learning. [CaCoVID;]
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration. [VisionTrim;ICLR 2026;GitHub]
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models. [FlashVLM;]
Focus: A Streaming Concentration Architecture for
Efficient Vision-Language Models. [Focus; GitHub]
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs. [EchoingPixels; Audio-Video]
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models. [HTC-VLM;]
Less Is More, but Where? Dynamic Token Compression via LLM-Guided
Keyframe Prior. [DyToK; GitHub]
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs. [LLaVA-UHD v3;]
FloC: FACILITY LOCATION-BASED EFFICIENT VI- SUAL TOKEN COMPRESSION FOR LONG VIDEO UN- DERSTANDING. [FloC;]
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models.[Visual Token Compression Benchmark]
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs. [VisionSelector; GitHub]
AutoPrune: Each Complexity Deserves a Pruning Policy. [AutoPrune;NIPS2025; GitHub]
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression. [LightVLM;]
MMG-Vid: Maximizing Marginal Gains at Segment-level
and Token-level for Efficient Video LLMs. [MMG-Vid;]
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference. [VISA; GitHub]
HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models. [HiPrune; GitHub]
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models. [GlimpsePrune; GitHub]
Short-LVLM: Compressing and Accelerating Large
Vision-Language Models by Pruning Redundant Layers. [Short-LVLM; GitHub]
When Tokens Talk Too Much: A Survey of
Multimodal Long-Context Token Compression across Images, Videos, and Audios. [Survey ;GitHub]
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning. [VisionThink; GitHub]
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs. [STTM;ICCV; GitHub]
Beyond Token Pruning: Operation Pruning in Vision-Language Models. [GSOP; GitHub]
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models. [LaCo;]
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs. [LLaVA-Scissor;Video; GitHub]
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models. [GreedyPrune;]
Learning Compact Vision Tokens for Efficient Large Multimodal Models. [LLaVA-STF;VQA; GitHub]
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding. [DynTok; Video;]
HoliTom: Holistic Token Merging for Fast Video Large Language Models. [HoliTom; Video; GitHub]
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models. [AdaTP; Video;]
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms. [CrossLMM; Video; GitHub]
Clapper: Compact Learning and Video Representation in VLMs. [Clapper; Video]
Video Compression Commander:Plug-and-Play Inference Acceleration for Video Large Language Models. [VidCom2; Video; GitHub]
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning. [LLaVA-Meteor]
Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering. [Explore-Then-Select; Video; EMNLP 2025; GitHub]
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding. [FiLA-Video;Video]
VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning. [VCM]
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos. [TimeChat-Online; Video; GitHub]
DYMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs. [DYMU;GitHub]
Quicksviewer: An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes. [Quicksviewer;Video;GitHub]
PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models. [PACT;CVPR 2025;GitHub]
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA. [QG-VTC;VQA]
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model. [TopV; CVPR 2025]
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression. [InternVL-X;GitHub]
Token Dynamics: Towards Efficient and Dynamic Video Token Representation for Video Large Language Model. [Token Dynamics;Video]
HICom:Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models. [HICom;2025 CVPR;Video;GitHub]
TwigVLM: Growing a Twig to Accelerate Large Vision-Language Models. [TwigVLM; ICCV 2025;GitHub]
FastVID: Dynamic Density Pruning for Fast Video Large Language Models. [FastVID;GitHub]
SAINT:Similarity-Aware Token Pruning: Your VLM but Faster. [SAINT;GitHub]
STORM:Token-Efficient Long Video Understanding for Multimodal LLMs. [STORM;Video;NVIDIA]
OpenReview Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification. [Dynamic-LLaVA; ICLR2025; GitHub]
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models. [DivPrune;GitHub]
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression. [FCoT-VL;]
Beyond Token Compression: A Training-Free Reduction Framework for Efficient Visual Processing in MLLMs. [Beyond Token Compression;GitHub]
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers. [Falcon; ICCV 2025; GitHub]
DyRate:Dynamic Token Reduction during Generation for Vision Language Models. [DyRate]
AdaFV: Accelerating VLMs with Self-Adaptive Cross-Modality Attention Mixture. [AdaFV]
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token. [LLAVA-MINI;GitHub]
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models. [FrameFusion;Video;GitHub]
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling. [VideoChat-Flash;Video;GitHub]
RETAKE: Reducing Temporal and Knowledge Redundancy for Long Video Understanding. [RETAKE;Video;GitHub]
FastVLM: Efficient Vision Encoding for Vision Language Models. [FastVLM;Apple;]
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models. [PVC;Video;GitHub]
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM. [Dynamic-VLM;Video;]
VisionZip: Longer is Better but Not Necessary in Vision Language Models. [VisionZip;Video;GitHub]
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay. [p-MoD: GitHub]
[CLS] Attention is All You Need for Training-Free Visual Token Pruning: Make VLM Inference Faster. [FasterVLM: GitHub]
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models. [ATP-LLaVA]
OpenReview LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token. [LLaVA-Mini]
Rethinking Token Reduction in MLLMs: Towards a Unified Paradigm for Training-Free Acceleration .[FiCoCo;]
OpenReview LVP: Language-guide Visual Projector for Efficient Multimodal LLM.[LVP]
OpenReview Efficient Multi-modal Large Language Models via Visual Token Grouping .[VisToG]
DyCoke:Dynamic Compression of Tokens for Fast Video Large Language Models .[DyCoke;Video;Github]
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression .[FocusLLaVA;]
MustDrop:Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model .[MustDrop;Github]
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization .[RLT;Video;NeurIPS 2024;Github]
Inference Optimal VLMs Need Only One Visual Token but Larger Models .[QueCC;Github]
Video Token Merging for Long-form Video Understandin .[Learnable VTM;Video]
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding .[LongVU;Video;Github]
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction .[PyramidDrop;Github]
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers .[Victor;]
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models .[VidCompress;]
Retrieval Replace Reduction:An effective visual token reduction method via semantic match .[TRSM;]
AVG-LLaVA: A Large Multimodal Model with Adaptive Visual Granularity .[AVG-LLaVA;Github]
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs .[TRIM]
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Consideration .[TC-LLaVA;Video;]
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings .[TG-LLaVA]
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding . [mPLUG-DocOwl2;Github]
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval . [TempMe;Video;ICLR 2025;Github]
Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information . [Recoverable Compression]
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models in Resource-Constrained Environments . [HiRED;Github]
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models. [mPLUG-Owl3;Github]
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding . [Token-level;Github]
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models . [HiRes-LLaVA;]
TokenPacker: Efficient Visual Projector for Multimodal LLM . [TokenPacker;Github]
VoCo-LLaMA: Towards Vision Compression with Large Language Models . [VoCo-LLaMA;Github]
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models . [DeCo;Github]
Matryoshka Query Transformer for Large Vision-Language Models . [MQT-LLaVA; NeurIPS 2024]Github]
Matryoshka Multimodal Models . [Matryoshka;M3]Github]
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites . [InternVL;Pixel-Shuffle;Github]
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference . [CATP;]
LLaVA-PruMerge:
Adaptive Token Reduction for Efficient Large Multimodal Models . [LLaVA-PruMerge;Github]
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-PLay Acceleration for VLLM Inference . [FastV;ECCV 2024;Github]
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model . [LDP-v2;Github]
When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression . [PtM;Github]
Video Patch Pruning: Efficient Video Instance Segmentation via Early Token
Reduction . [VPP;Github]
ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT . [ToaSt]
Lossless Token Merging Even Without Fine-Tuning in Vision Transformers . [ATM]
Prune and Merge: Efficient Token Compression For Vision Transformer With Spatial Information Preserved . [Prune and Merge;Github]