 StepPrune: Adaptive Sequential Visual Token Selection across Multimodal Large Language Models Hansen Zhang, Landi He, Mingde Yao, Lijian Xu Related: Stepwise Token Selection | 2026/09 | - |  |     |
 Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs (VIP-Router) Haiji Liang, Pengfei Zhou, Zhenglin Wan, Wei Wang, Yang You, Wangbo Zhao | 2026/09 | - |  |     |
 TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents Yuhao Wang, Mu Qiao, Xindong Zhang, Yunzhi Zhuge, Lei Zhang, Huchuan Lu | 2026/09 | - |  GUI screenshots |     |
 CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu, Sreyas Mohan, Wei Ye, Dilin Wang, JQ Huang, Rakesh Ranjan, Aviral Chharia, Fernando De la Torre | 2026/09 | GitHub Code coming soon |  Multi-view 3D |     |
CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding Jing Jiang, Yiran Ling, Ruonan Li, Dimitrios Stamoulis, Jie Liu | 2026/09 | - |  |     |
Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization Qingchan Zhu, Weihang You, Hanqi Jiang, Changdi Yang, Tianming Liu, Geng Yuan | 2026/09 | - |  |     |
 S2Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models Yuanyuan Jia, Shunpu Tang, Qianqian Yang | 2026/09 | GitHub |  |     |
 SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models Shiyu Li, Zi-Yuan Hu, Shijia Huang, Yanyang Li, Yiwu Zhong, Liwei Wang | 2026/09 | - |  |     |
 From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers (RaDiCal) Siyi Liu, Hanjun Yang, Chenchen Zhang, Xiaorong Zhu, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang | 2026/09 | - |  Image reranking |     |
 Visual Token Coding for Video Multimodal Large Language Models (VTC) Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji | 2026/08 | GitHub |  |     |
 Aggregating Visual Information with Optimal Transport for VideoLM Token Compression (AVIOT) Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang | 2026/08 | GitHub |  |     |
 CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang | 2026/08 | GitHub Code coming soon |  Multi-view 3D |     |
 When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs (SIEVE) Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo | 2026/08 | - |  |     |
 An AI4AI Framework for Visual Token Pruning (AutoPrune) Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu | 2026/08 | - |  |     |
 RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo | 2026/08 | GitHub |  |     |
 OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding | 2026/08 | GitHub |  |     |
 Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang | 2026/08 | - |  |     |
 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering Changwoo Baek, Kyeongbo Kong | 2026/08 | GitHub |  |     |
 Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang | 2026/08 | GitHub |  |     |
 CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu | 2026/07 | GitHub |  |     |
 Visual Token Compression Enhances Robustness of MLLMs Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong | 2026/07 | GitHub |  |     |
 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, et al. | 2026/07 | - |  | - |
 VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu | 2026/07 | GitHub |  |     |
 Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models (SpecFlow) Zhaoyang Li, Yanjun Li, Wangkai Li, Yujia Chen, Tianzhu Zhang | 2026/07 | GitHub |  |     |
 AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning Kyuan Oh, Bumsoo Kim | 2026/07 | GitHub |  |     |
 Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning (EADP) Xuehui Wang, Xuankun Yang, Wei Shen | 2026/07 | GitHub |  |     |
 Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models (CLSE) Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen | 2026/06 | GitHub |  |     |
 Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein | 2026/06 | - |  |     |
 Stepwise Token Selection for Efficient Multimodal Large Language Models Landi He, Shawn Young, Lijian Xu Related: StepPrune | 2026/06 | - |  |     |
 Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression (BACON) Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee | 2026/06 | Project |  |     |
 One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs (ALVTS) Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu | 2026/06 | - |  |     |
 AVEX-Prune: Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning Zihan Meng, Dexiang Hong, Weidong Chen, Ziyu Zhou, Bo Hu, Zhendong Mao | 2026/06 | - |  |     |
 InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models Xinxin Liu, Shiwei Gan, Xiao Liu, Yafeng Yin, Lei Xie, Sanglu Lu | 2026/06 | - |  |     |
 EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Pengfei Zhang, Yao Hu, Jiawei Li, Shikai Jiang | 2026/06 | - |  |     |
 RESTORE: Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference Hyeonwoo Cho, Donghyeon Baek, Yewon Kim, Bumsub Ham | 2026/06 | Project |  |     |
 CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models Chenxi Du, Yongheng Deng, Jiani Liu, Yujia Zhang, Xi Chen, Ju Ren | 2026/06 | - |  |     |
 Semantic-Guided Slow-Fast Pruning of Visual Tokens for Vision-Language Models Zheng-Wei Liu, Eugene Lee, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee | 2026/05 | - |  |     |
 StateKV: Linear Scaling Video VLMs for Long Video Understanding Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles | 2026/05 | - |  |     |
 EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision Rosario Forte, Giuseppe Lando, Antonino Furnari | 2026/05 | - |  | - |
 VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning Hengbo Xu, Shengjie Jin, Yanbiao Ma, Zhiwu Lu | 2026/05 | - |  |      |
 EarlyTom: Early Token Compression Completes Fast Video Understanding Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang | 2026/05 | Project |  |     |
 OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang | 2026/05 | - |  |     |
 MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao | 2026/05 | GitHub |  |     |
 Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding (ST-GridPool) Bingjun Luo, Tony Wang, Hanqi Chen, Xinpeng Ding | 2026/05 | GitHub |  |     |
 SEATS: Stage-adaptive Token Selection for Efficient Omni-modal LLMs Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li | 2026/05 | GitHub |  |     |
 DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs Minyoung Park, Taehun Kong, Sangjun Ahn | 2026/05 | - |  |     |
 Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models (VIF) Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang | 2026/05 | GitHub |  |     |
 LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong | 2026/05 | Project |  |     |
 KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen | 2026/05 | - |  |     |
 GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao | 2026/05 | - |  |     |
 CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large Vision-Language Models (LiteLVLM) Sangin Lee, Yukyung Choi | 2026/05 | GitHub |  |     |
 OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han | 2026/05 | - |  |     |
 OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee | 2026/05 | GitHub |  |     |
 Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models (COAST) Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun | 2026/05 | - |  |     |
 LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs? Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao | 2026/05 | - |  |     |
 ETCTrack: An Efficient Token Compression Framework for Visual Object Tracking Weijing Wu, Qihua Liang, Bineng Zhong, Haiying Xia, Zhiyi Mo, Shuxiang Song | 2026/05 | GitHub |  |     |
 SAVEMem: Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding Hang Wu, Sherin Mary Mathews, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang | 2026/05 | - |  |     |
 VLMaxxing through FrameMogging: Training-Free Anti-Recomputation for Video Vision-Language Models JF Bastien, Sam D'Amico | 2026/05 | GitHub |  |     |
 LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models Rinyoichi Takezoe, Yi Li, Zhe Bo, Atsuhiro Hou, Guang Meng, Keisuke Long | 2026/04 | - |  |     |
 Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs (SToP) Kibum Kim, Joonhwan Kim, Kyoungmin Min, Yuxuan Wang, Jeonghun Moon, Julian McAuley, Chanwoo Park | 2026/04 | GitHub |  |     |
 ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao | 2026/04 | - |  |     |
 EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling Jiatao Qu, Fengwei Zhou, Wenjing Li, Tao Wu, Guanxiong Xue, Zhicheng Zhao, Dong Wei, Yu Lu, Byunghan Na | 2026/04 | - |  |     |
 One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding (XComp) Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang | 2026/04 | GitHub |  |     |
 MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis Simin Huo, Ni Li | 2026/04 | GitHub |  |     |
 VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir | 2026/04 | Project |  |     |
 Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models (DeSAP) Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao | 2026/04 | - |  |     |
 Tango: Taming Visual Signals for Efficient Video Large Language Models Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen | 2026/04 | GitHub |  |     |
 Do Vision Language Models Need to Process Image Tokens? Soumya Ghosh, R.V. Babu, Chirag Agarwal | 2026/04 | - |  |     |
 Tempo: Small Vision-Language Models are Smart Compressors for Long Video Understanding Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu | 2026/04 | Project |  |     |
 HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan | 2026/04 | - |  |     |
 HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li | 2026/04 | - |  |     |
 ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference Zhaohong Huang, Wei Liu, Yuxin Zhang, Fei Chao, Rongrong Ji | 2026/04 | - |  |     |
 KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models Haifeng Huang, Yang Li | 2026/04 | - |  |     |
 MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko | 2026/04 | - |  |     |
 Token Warping Helps MLLMs Look from Nearby Viewpoints Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung | 2026/04 | Project |  | - |
 GroundVTS: Visual Token Sampling in MLLMs for Video Temporal Grounding Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang | 2026/04 | GitHub |  |     |
 PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding Yanjie Zhou, Yuxin Zhang, Jun Chen et al. | 2026/04 | GitHub |  |     |
 SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering Wenli Li, Kai Zhao, Haoran Jiang et al. | 2026/03 | - |  |     |
 AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding Haozhe Qi, Kevin Qu, Mahdi Rad et al. | 2026/03 | Project |  |     |
 Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning (SCORE) Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu | 2026/03 | - |  |     |
 ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji | 2026/03 | GitHub |  |     |
 Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention Junhao Du et al. | 2026/03 | - |  |     |
 Unified Spatio-Temporal Token Scoring for Efficient Video VLMs Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee | 2026/03 | - |  |     |
 Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs (AwaRes) Moshe Kimhi, Artem Spector, Sivan Haray, Ehud Rivlin, Chaim Baskin, Raja Giryes, Eli Schwartz | 2026/03 | Project |  |     |
 Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models Sijie Li, Biao Qian, Jungong Han | 2026/03 | - |  |     |
 DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression Bingzhou Li, Tao Huang | 2026/03 | GitHub |  |     |
 Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang | 2026/03 | GitHub |  |     |
 Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon | 2026/03 | - |  |     |
 ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference Surendra Pathak, Bo Han | 2026/03 | - |  |     |
 Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models (TPRL) Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang | 2026/03 | GitHub |  |     |
 AutoGaze: Attend Before Attention — Efficient and Scalable Video Understanding via Autoregressive Gazing Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin | 2026/03 | Project |  |     |
 ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao | 2026/03 | GitHub |  |     |
 Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity (PruneSID) Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang, Guangming Lu, Jun Yu, Wenjie Pei | 2026/03 | GitHub |  |     |
 E-AdaPrune: Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models Jialuo He, Huangxun Chen | 2026/03 | - |  |     |
 SemVID: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding Jiaqi Li, Shuntian Zheng, Yixian Shen, Xiangru Jian, Zhiqi Li, Yuncheng Li | 2026/03 | - |  |     |
 EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs Yuhao Chen, Bin Shan, Xin Ye, Shu Wang, Jiashu Zhang | 2026/03 | - |  |     |
 AOT: Token Reduction via Local and Global Contexts Optimization for Efficient Video LLMs Jinlong Li, Xinyu Li, Trong-Tung Nguyen, Yong Jae Lee, Nicu Sebe | 2026/03 | Project |  |     |
 AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in LVLMs Changwoo Baek, Jouwon Song, Seunghun Lee, Jong-Ok Kim | 2026/03 | GitHub |  |     |
 TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning Zhuo Chen, Shawn Young, Di Liu, Yuan Zhang, Wentao Zheng, Yilin Jia, Lijian Xu | 2026/03 | Code |  |     |
 Stateful Token Reduction for Long-Video Hybrid VLMs Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko, Karan Sapra, Zhiding Yu, Guilin Liu | 2026/03 | - |  |     |
 PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen | 2026/02 | GitHub |  |     |
 HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen | 2026/02 | GitHub |  |     |
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents Zhou Xu, Bowen Zhou, Qi Wang, Shuwen Feng, Jingyu Xiao | 2026/02 | - |  | - |
 OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang | 2026/02 | GitHub |  |     |
 ApET: Approximation-Error Guided Token Compression for Efficient VLMs Qiankun Ma, Ziyao Zhang, Haofei Wang, Jie Chen, Zhen Song, Hairong Zheng | 2026/02 | GitHub |  |     |
 DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference Aditya Kumar Singh, Hsin-Pai Cheng, Sairam Sundaresan, Bhavin Jawade, Karthikeyan Saravanan, Saransh Rajput, Jinjun Xiong, Syed Zawad, Elias B. Khalil, Vijaykrishnan Narayanan | 2026/02 | GitHub |  |     |
 EntropyPrune: Matrix Entropy Guided Visual Token Pruning for MLLMs Yahong Wang, Juncheng Wu, Zhangkai Ni, Chengmei Yang, Yihang Liu, Longzhen Yang | 2026/02 | GitHub |  |     |
 Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models (Sali-Cache) Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla | 2026/02 | - |  |     |
 IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu | 2026/02 | - |  |     |
 Vision Token Reduction via Attention-Driven Self-Compression for Efficient MLLMs Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan | 2026/02 | - |  |     |
 SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Ho Gun Park, Il Yong Chun | 2026/02 | - |  |     |
 TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models Xiangtian Zheng, Zishuo Wang, Yuxin Peng | 2026/02 | - |  |     |
 FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging Ziyang Fan, Keyu Chen, Ruilong Xing, Yulin Li, Li Jiang, Zhuotao Tian | 2026/02 | GitHub |  |     |
 Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning Enwei Tong, Yuanchao Bai, Yao Zhu, Junjun Jiang, Xianming Liu | 2026/02 | GitHub |  |     |
 When LLaVA Meets Objects: Token Composition for Vision-Language-Models Soumya Jahagirdar, Walid Bousselham, Anna Kukleva, Hilde Kuehne | 2026/02 | - |  |     |
 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang | 2026/02 | - |  |     |
 PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective Haokui Zhang, Congyang Ou, Dawei Yan, Peng Wang, Qingsen Yan, Ying Li | 2026/02 | GitHub |  |     |
 Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen | 2026/02 | GitHub |  |     |
 KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo | 2026/02 | - |  |     |
 SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma | 2026/02 | - |  |     |
 IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning Zhichao Sun, Yidong Ma, Gang Liu, Yibo Chen, Xu Tang, Yao Hu, Yongchao Xu | 2026/02 | GitHub |  |     |
 Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning Yihong Huang, Fei Ma, Yihua Shao, Jingcai Guo, Zitong Yu, Laizhong Cui | 2026/02 | - |  |     |
 HAE: Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models Xiang Liu, Mingzhu Shen, Fangyi Li, Rui Lu, Pete Burnap, Yiming Ying | 2026/02 | - |  |     |
 CaCoVID: Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning Yinchao Ma, Qiang Zhou, Zhibin Wang, Zhen Song, Jionglong Su | 2026/02 | GitHub |  |     |
 Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models Yihang Rao et al. | 2026/01 | - |  |   |
 Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models Yuting Huang, Leilei Ding, Zhipeng Tang, Zenghuan Zhu, Jiajun Deng | 2026/01 | - |  |     |
 Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Shuo Yang | 2026/01 | - |  |     |
 CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models Samyak Jha, Junho Kim | 2026/01 | - |  |     |
 ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning Xiaoshu Chen, Sihang Zhou, Ke Liang, Xinwang Liu | 2026/01 | - |  |     |
 VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu | 2026/01 | GitHub |  |     |
 ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation Zihao Huang, Jundong Zhou, Xingwei Qu, Qiyang Min, Ge Zhang | 2026/01 | - |  |     |
 Efficient Token Pruning for LLaDA-V Zhewen Wan, Tianchen Song, Chen Lin, Zhiyong Zhao, Xianpeng Lang | 2026/01 | - |  |     |
 Video-KTR: Reinforcing Video Reasoning via Key Token Attribution Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang | 2026/01 | GitHub |  |     |
 ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang | 2026/01 | - |  |     |
 DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He | 2026/01 | - |  |     |
 Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring Dongxu Zhang, Yiding Sun, Cheng Tan, Wenbiao Yan, Ning Yang | 2026/01 | - |  |     |
 FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung | 2026/01 | - |  |     |
 Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression Yuliang Cai, Dongqiangzi Ye, Zitian Chen, Chongruo Wu | 2026/01 | - |  |     |
 FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection Mingyu Ouyang, Kevin Qinghong Lin, Mike Zheng Shou, Hwee Tou Ng | 2026/01 | GitHub |  |     |
 STC: Accelerating Streaming Video Large Language Models via Hierarchical Token Compression Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang | 2025/12 | GitHub |  |     |
 TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts Hao Zhang, Mengsi Lyu, Bo Huang, Yulong Ao, Yonghua Lin | 2025/12 | - |  |     |
 FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang | 2025/12 | - |  |     |
 FlashCache: Revisiting Multimodal KV Cache Compression via Frequency-Domain-Guided Outlier-KV-Aware Approach Zihao Huang, Haotian Chen, Suozhi Huang, Jieru Zhao, Minyi Guo | 2025/11 | - |  |     |
 OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang | 2025/11 | GitHub |  |     |
 Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu | 2025/10 | GitHub
| - | - |
 Don’t Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention Xin Zou, Di Lu, Yizhou Wang, Yibo Yan, Yuanhuiyi Lyu, Xu Zheng, Linfeng Zhang, Xuming Hu | 2025/10 | GitHub |  |     |
 ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models Jewon Lee, Wooksu Shin, Seungmin Yang, Ki-Ung Song, DongUk Lim, Jaeyeon Kim, Tae-Ho Kim, Bo-Kyeong Kim | 2025/09 | GitHub |  |     |
Training-Free Pyramid Token Pruning for Efficient Large Vision-Language Models via Region, Token, and Instruction-Guided Importance Yuxuan Liang, Xu Li, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue | 2025/09 | - |  |     |
 Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors Xiangchen Wang, Jinrui Zhang, Teng Wang, Haigang Zhang, Feng Zheng | 2025/09 | GitHub Model |  |    |
 Variation-aware Vision Token Dropping for Faster Large Vision-Language Models Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen | 2025/09 | GitHub |  |     |
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models Hao Zhang, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin | 2025/09 | - |  |     |
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding Jinming Liu, Junyan Lin, Yuntao Wei, Kele Shao, Keda Tao, Jianguo Huang, Xudong Yang, Zhibo Chen, Huan Wang, Xin Jin | 2025/08 | - | - | - |
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models Huyu Wu, Meng Tang, Xinhan Zheng, Haiyun Jiang | 2025/08 | - |  |      |
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance Weichen Zhang, Zhui Zhu, Ningbo Li, Kebin Liu, Yunhao Liu | 2025/08 | - |  |     |
Fourier-VLM: Compressing Vision Tokens in the Frequency Domain for Large Vision-Language Models Huanyu Wang, Jushi Kai, Haoli Bai, Lu Hou, Bo Jiang, Ziwei He, Zhouhan Lin | 2025/08 | - |  |     |
 VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization Sihan Yang, Runsen Xu, Chenhang Cui, Tai Wang, Dahua Lin, Jiangmiao Pang | 2025/08 | GitHub
| 
 | 




 |
 A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models Quan-Sheng Zeng, Yunheng Li, Qilong Wang, Peng-Tao Jiang, Zuxuan Wu, Ming-Ming Cheng, Qibin Hou | 2025/08 | GitHub Model |  |     |
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs Junpeng Ma, Qizhe Zhang, Ming Lu, Zhibin Wang, Qiang Zhou, Jun Song, Shanghang Zhang | 2025/08 | - |  | - |
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering Kang Zeng, Guojin Zhong, Jintao Cheng, Jin Yuan, Zhiyong Li | 2025/08 | - | - | - |
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models Zicong Tang, Ziyang Ma, Suqing Wang, Zuchao Li, Lefei Zhang, Hai Zhao, Yun Li, Qianren Wang | 2025/08 | - | - | - |
PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models Kai Zhao, Wubang Yuan, Alex Lingyu Hung, Dan Zeng | 2025/08 | - | - | - |
 MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian | 2025/08 | GitHub Project Page | - | - |
 SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning Yicheng Ji, Jun Zhang, Heming Xia, Jinpeng Chen, Lidan Shou, Gang Chen, Huan Li | 2025/08 | GitHub |  |     |
 InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, Zhaokai Wang, Zhe Chen, et al. | 2025/08 | GitHub Model |  | - |
 LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit Chengtao Lv, Bilang Zhang, Yang Yong, Ruihao Gong, Yushi Huang, Shiqiao Gu, Jiajun Wu, Yumeng Shi, Jinyang Guo, Wenya Wang | 2025/08 | GitHub
|  | - |
ADMIRE: ADaptive method to enhance Multiple Image REsolutions in text-rich multi-image understanding Qipeng Zhu, Xiong Wang, Zhihong Lu, Jiangwei Lao, Congyun Jin, Jie Chen, Yingzhe Peng, Qi Zhu, Lianzhen Zhong, Jiajia Liu, Peng Wei, Jian Wang | 2025/08 | - |  |     |
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning Yanshu Li, Jianjiang Yang, Zhennan Shen, Ligong Han, Haoyan Xu, Ruixiang Tang | 2025/08 | - |  |     |
 HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models Jizhihui Liu, Feiyi Du, Guangdao Zhu, Niu Lian, Jun Li, Bin Chen | 2025/08 | GitHub |  |     |
 METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Yuchen Liu, Yaoming Wang, Bowen Shi, Xiaopeng Zhang, Wenrui Dai, Chenglin Li, Hongkai Xiong, Qi Tian | 2025/07 | GitHub
|  |     |
 Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata | 2025/07 | - |  |    |
 TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model Ao Li, Yuxiang Duan, Jinghui Zhang, Congbo Ma, Yutong Xie, Gustavo Carneiro, Mohammad Yaqub, Hu Wang | 2025/07 | GitHub
|  |     |
 When Tokens Talk Too Much: A Survey of Multimodal Long-Context Token Compression Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang | 2025/07 | GitHub | - | - |
Token Compression Meets Compact Vision Transformers: A Survey and Comparative Evaluation for Edge AI Phat Nguyen, Ngai-Man Cheung | 2025/07 | - | - | - |
 Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers Ji Ma, Wei Suo, Peng Wang, Yanning Zhang | 2025/07 | GitHub
|  |      |
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs Jeongseok Hyun, Sukjun Hwang, Su Ho Han, Taeoh Kim, Inwoong Lee, Dongyoon Wee, Joon-Young Lee, Seon Joo Kim, Minho Shim | 2025/07 | GitHub Project Page |  |     |
 VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Senqiao Yang, Junyi Li, Xin Lai, Bei Yu, Hengshuang Zhao, Jiaya Jia | 2025/07 | GitHub Model |  |    |
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent Jiaao Li, Kaiyuan Li, Chen Gao, Yong Li, Xinlei Chen | 2025/07 | - |  |    |
 Beyond Token Pruning: Operation Pruning in Vision-Language Models Aoming Liu, Reuben Tan, Boqing Gong, Bryan A. Plummer | 2025/07 | GitHub |  |    |
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models Juntao Liu, Liqiang Niu, Wenchao Chen, Jie Zhou, Fandong Meng | 2025/07 | - |  |     |
Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment Rui Xu, Yunke Wang, Yong Luo, Bo Du | 2025/06 | - |  |     |
 Learning Compact Vision Tokens for Efficient Large Multimodal Models Hao Tang, Chengchao Shen | 2025/06 | GitHub Model |  |     |
 Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration Fanhu Zeng, Deli Yu, Zhenglun Kong, Hao Tang | 2025/06 | - |  |     |
 Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs Qizhe Zhang, Mengzhen Liu, Lichen Li, Ming Lu, Yuan Zhang, Junwen Pan, Qi She, Shanghang Zhang | 2025/06 | GitHub Project Page |  | - |
 FlexSelect: Flexible Token Selection for Efficient Long Video Understanding Yunzhu Zhang, Yu Lu, Tianyi Wang, Fengyun Rao, Yi Yang, Linchao Zhu | 2025/06 | GitHub Project Page Model | - | - |
 Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu | 2025/06 | GitHub
|  |     |
 Generic Token Compression in Multimodal Large Language Models from an Explainability Perspective Lei Lei, Jie Gu, Xiaokang Ma, Chu Tang, Jingmin Chen, Tong Xu | 2025/06 | - |  |     |
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs Jiahui Wang, Zuyan Liu, Yongming Rao, Jiwen Lu | 2025/06 | GitHub Project Page |  |     |
 Flash-VStream: Efficient Real-Time Understanding for Long Video Streams Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Xiaojie Jin | 2025/06 | GitHub Project Page Model |  |    |
 LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs Boyuan Sun, Jiaxing Zhao, Xihan Wei, Qibin Hou | 2025/06 | GitHub Model |  |     |
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models Ruiguang Pei, Weiqing Sun, Zhihui Fu, Jun Wang | 2025/06 | - |  |     |
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding Hongzhi Zhang, Jingyuan Zhang, Xingguang Ji, Qi Wang, Fuzheng Zhang | 2025/06 | - |  |     |
 Seed1.5-VL Technical Report ByteDance Seed | 2025/05 | GitHub Demo Homepage |  |     |
 Token Reduction Should Go Beyond Efficiency in Generative Models – From Vision, Language to Multimodality Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik | 2025/05 | GitHub
| - | - |
 Corematching: A co-adaptive sparse inference framework with token and neuron pruning for comprehensive acceleration of vision-language models Qinsi Wang, Hancheng Ye, Ming-Yu Chung, Yudong Liu, Yueqian Lin, Martin Kuo, Mingyuan Ma, Jianyi Zhang, Yiran Chen | 2025/05 | GitHub
|  |     |
Balanced token pruning: Accelerating vision language models beyond local optimization Kaiyuan Li, Xiaoyue Chen, Chen Gao, Yong Li, Xinlei Chen | 2025/05 | GitHub
|  |     |
ToDRE: Visual Token Pruning via Diversity and Task Relevance for Multimodal LLMs Duo Li, Zuhao Yang, Shijian Lu | 2025/05 | - |  |     |
 HoliTom: Holistic Token Merging for Fast Video Large Language Models Kele Shao, Keda Tao, Can Qin, Haoxuan You, Yang Sui, Huan Wang | 2025/05 | GitHub Project Page |  |     |
 VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models Ce Zhang, Kaixin Ma, Tianqing Fang, Wenhao Yu, Hongming Zhang, Zhisong Zhang, Yaqi Xie, Katia Sycara, Haitao Mi, Dong Yu | 2025/05 | GitHub
|  |     |
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models Fengyuan Sun, Leqi Shen, Hui Chen, Sicheng Zhao, Jungong Han, Guiguang Ding | 2025/05 | - |  |     |
 CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang | 2025/05 | GitHub
|  |     |
Clapper: Compact Learning and Video Representation in VLMs Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang, Jianzhao Huang, Kunze Li, Qi Wang, Fuzheng Zhang | 2025/05 | - |  |    |
 Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models Xuyang Liu, Yiyu Wang, Junpeng Ma, Linfeng Zhang | 2025/05 | GitHub
|  |     |
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning Bonan li, Zicheng Zhang, Songhua Liu, Weihao Yu, Xinchao Wang | 2025/05 | - |  | 


 |
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naïve Integration via Multi-Objective Balanced Covering Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu | 2025/05 | - | - | - |
Lossless Token Merging Even Without Fine-Tuning in Vision Transformers Jaeyeon Lee, Dong-Wan Choi | 2025/05 | - |  | - |
 Token Sequence Compression for Efficient Multimodal Computing Yasmine Omri, Parth Shroff, Thierry Tambe | 2025/04 | - |  |     |
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding Yanan Guo, Wenhui Dong, Jun Song, Shiding Zhu, Xuan Zhang, Hanqing Yang, Yingbo Wang, Yang Du, Xianing Chen, Bo Zheng | 2025/04 | - |  |    |
 TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models Jaewoo Lee, Keyang Xuan, Chanakya Ekbote, Sandeep Polisetty, Yi R. Fung, Paul Pu Liang | 2025/04 | GitHub
| - |  |
 VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning Run Luo, Renke Shan, Longze Chen, Ziqiang Liu, Lu Wang, Min Yang, Xiaobo Xia | 2025/04 | GitHub
|  |     |
 TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos Linli Yao, Yicheng Li, Yuancheng Wei, Lei Li, Shuhuai Ren, Yuanxin Liu, Kun Ouyang, Lean Wang, Shicheng Li, Sida Li, Lingpeng Kong, Qi Liu, Yuanxing Zhang, Xu Sun | 2025/04 | GitHub Project Page Dataset Model |  |     |
 DYMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs Zhenhailong Wang, Senthil Purushwalkam, Caiming Xiong, Silvio Savarese, Heng Ji, Ran Xu | 2025/04 | GitHub Project Page Model |  |     |
 Quicksviewer: An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes Ji Qi, Yuan Yao, Yushi Bai, Bin Xu, Juanzi Li, Zhiyuan Liu, Tat-Seng Chua | 2025/04 | GitHub Project Page |  |      |
 PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models Mohamed Dhouib, Davide Buscaldi, Sonia Vanier, Aymen Shabou | 2025/04 | GitHub
|  | 





 |
 QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA Shuai Li, Jian Xu, Xiao-Hui Li, Chao Deng, Lin-Lin Huang | 2025/04 | - |  |    |
 FastVID: Dynamic Density Pruning for Fast Video Large Language Models Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding | 2025/03 | GitHub
|  |     |
 Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models Bozhi Luan, Wengang Zhou, Hao Feng, Zhe Wang, Xiaosong Li, Houqiang Li | 2025/03 | GitHub
| - | - |
Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory Saket Gurukar, Asim Kadav | 2025/03 | - |  |     |
 Tokencarve: Information-preserving visual token compression in multimodal large language models Xudong Tan, Peng Ye, Chongjun Tu, Jianjian Cao, Yaoxin Yang, Lin Zhang, Dongzhan Zhou, Tao Chen | 2025/03 | GitHub
| - | - |
 Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping Weili Zeng, Ziyuan Huang, Kaixiang Ji, Yichao Yan | 2025/03 | GitHub
|  |     |
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model Cheng Yang, Yang Sui, Jinqi Xiao, Lingyi Huang, Yu Gong, Chendi Li, Jinghua Yan, Yu Bai, Ponnuswamy Sadayappan, Xia Hu, Bo Yuan | 2025/03 | - |  |     |
 InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression Dongchen Lu, Yuyao Sun, Zilu Zhang, Leping Huang, Jianliang Zeng, Mao Shu, Huo Cao | 2025/03 | GitHub Model |  |    |
 Token Dynamics: Towards Efficient and Dynamic Video Token Representation for Video Large Language Model Haichao Zhang, Yun Fu | 2025/03 | GitHub Project Page Model |  |   |
 HICom: Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models Zhihang Liu, Chen-Wei Xie, Pandeng Li, Liming Zhao, Longxiang Tang, Yun Zheng, Chuanbin Liu, Hongtao Xie | 2025/03 | GitHub Model |  |    |
 Similarity-Aware Token Pruning: Your VLM but Faster Ahmadreza Jeddi, Negin Baghbanzadeh, Elham Dolatabadi, Babak Taati | 2025/03 | GitHub
|  |     |
 Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding Xiangrui Liu, Yan Shu, Zheng Liu, Ao Li, Yang Tian, Bo Zhao | 2025/03 | GitHub
|  |     |
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs Jindong Jiang, Xiuyu Li, Zhijian Liu, Muyang Li, Guo Chen, Zhiqi Li, De-An Huang, Guilin Liu, Zhiding Yu, Kurt Keutzer, Sungjin Ahn, Jan Kautz, Hongxu Yin, Yao Lu, Song Han, Wonmin Byeon | 2025/03 | Project Page |  | 


 |
 DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models Saeed Ranjbar Alvar, Gursimran Singh, Mohammad Akbari, Yong Zhang | 2025/03 | GitHub
|  |     |
 When LVLM Meets Large RS Imagery: Coarse-to-Fine Text-Guided Token Pruning Junwei Luo, Yingying Zhang, Xue Yang, Kang Wu, Qi Zhu, Lei Liang, Jingdong Chen, Yansheng Li | 2025/03 | GitHub Dataset | - | - |
Silent Hazards of Token Reduction in Vision-Language Models Yizheng Sun, Hao Li, Chang Xu, Hongpeng Zhou, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun | 2025/03 | - | - | - |
 Prune and Merge: Efficient Token Compression For Vision Transformer With Spatial Information Preserved Junzhu Mao, Yang Shen, Jinyang Guo, Yazhou Yao, Xiansheng Hua | 2025/03 | GitHub
|  |    |
 Qwen2.5-VL Technical Report QwenTeam | 2025/02 | GitHub Model |  |     |
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models Yu Meng, Kaiyuan Li, Chenran Huang, Chen Gao, Xinlei Chen, Yong Li, Xiaoping Zhang | 2025/02 | - | - | - |
Stop Looking for Important Tokens in Multimodal Language Models for Token Pruning Zichen Wen, Yifeng Gao, Shaobo Wang, Junyuan Zhang, Qintong Zhang, Weijia Li, Conghui He, Linfeng Zhang | 2025/02 | GitHub
|  |     |
FCoT-VL: Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression Jianjian Li, Junquan Fan, Feng Tang, Gang Huang, Shitao Zhu, Songlin Liu, Nian Xie, Wulong Liu, Yong Liao | 2025/02 | - |  |     |
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem? Zichen Wen, Yifeng Gao, Weijia Li, Conghui He, Linfeng Zhang | 2025/02 | - | - | - |
 Beyond Token Compression: A Training-Free Reduction Framework for Efficient Visual Processing in MLLMs Hongliang Li, Jiaxin Zhang, Wenhui Liao, Dezhi Peng, Kai Ding, Lianwen Jin | 2025/01 | GitHub
|  |   |
 FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal LLMs via Visual Registers Renshan Zhang, Rui Shao, Gongwei Chen, Miao Zhang, Kaiwen Zhou, Weili Guan, Liqiang Nie | 2025/01 | GitHub Project Page |  |     |
LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models Yizheng Sun, Yanze Xin, Hao Li, Jingyuan Sun, Chenghua Lin, Riza Batista-Navarro | 2025/01 | - | - | - |
 FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance Haicheng Wang, Zhemeng Yu, Gabriele Spadaro, Chen Ju, Victor Quétu, Shuai Xiao, Enzo Tartaglione | 2025/01 | GitHub
| - | - |
 Compression with Global Guidance: Towards Training-Free High-Resolution MLLMs Acceleration Xuyang Liu, Ziming Wang, Yuhang Han, Yingyao Wang, Jiale Yuan, Jun Song, Bo Zheng, Linfeng Zhang, Siteng Huang, Honggang Chen | 2025/01 | GitHub
| - | - |
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph Yutao Jiang, Qiong Wu, Wenhao Lin, Wei Yu, Yiyi Zhou | 2025/01 | GitHub
|  |     |
 DyRate: Dynamic Token Reduction during Generation for Vision Language Models Xiaoyu Liang, Chaofeng Guan, Jiaying Lu, Huiyao Chen, Huan Wang, Haoji Hu | 2025/01 | GitHub
|  |     |
 VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding Boqiang Zhang, Kehan Li, Zesen Cheng, Zhiqiang Hu, Yuqian Yuan, Guanzheng Chen, Sicong Leng, Yuming Jiang, Hang Zhang, Xin Li, Peng Jin, Wenqi Zhang, Fan Wang, Lidong Bing, Deli Zhao | 2025/01 | GitHub
|  | - |
AdaFV: Rethinking of Visual-Language alignment for VLM acceleration Jiayi Han, Liang Du, Yiwen Wu, Xiangguo Zhou, Hongwei Du, Weibo Zheng | 2025/01 | - |  |    |
 Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models Xuyang Liu, Ziming Wang, Junjie Chen, Yuhang Han, Yingyao Wang, Jiale Yuan, Jun Song, Linfeng Zhang, Siteng Huang, Honggang Chen | 2025/01 | GitHub
| - | - |
 LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token Shaolei Zhang, Qingkai Fang, Zhe Yang, Yang Feng | 2025/01 | GitHub Model |  |    |
 FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models Tianyu Fu, Tengxuan Liu, Qinghao Han, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang | 2025/01 | GitHub Project Page |  |     |
 VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling Xinhao Li, Yi Wang, Jiashuo Yu, Xiangyu Zeng, Yuhan Zhu, Haian Huang, Jianfei Gao, Kunchang Li, Yinan He, Chenting Wang, Yu Qiao, Yali Wang, Limin Wang | 2025/01 | GitHub Demo Model |  |     |
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Redundancy Modeling Ke Wang, Hong Xuan | 2024/12 | - |  |      |
 AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning Yiwu Zhong, Zhuoming Liu, Yin Li, Liwei Wang | 2024/12 | GitHub
|  | 


 |
 LinVT: Empower Your Image-level Large Language Model to Understand Videos Lishuai Gao, Yujie Zhong, Yingsen Zeng, Haoxian Tan, Dengjie Li, Zheng Zhao | 2024/12 | GitHub
|  |     |
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction Shiyu Zhao, Zhenting Wang, Felix Juefei-Xu, Xide Xia, Miao Liu, Xiaofang Wang, Mingfu Liang, Ning Zhang, Dimitris N. Metaxas, Licheng Yu | 2024/12 | - |  |     |
St3: Accelerating multimodal large language model by spatial-temporal visual token trimming Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu | 2024/12 | - |  |     |
 iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models Lianyu Hu, Fanhua Shang, Liang Wan, Wei Feng | 2024/12 | GitHub
|  | - |
 Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration Mark Endo, Xiaohan Wang, Serena Yeung-Levy | 2024/12 | GitHub
|  |     |
 PruneVid: Visual Token Pruning for Efficient Video Large Language Models Xiaohu Huang, Hao Zhou, Kai Han | 2024/12 | GitHub Project Page |  |     |
 RETAKE: Reducing Temporal and Knowledge Redundancy for Long Video Understanding ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding | 2024/12 | GitHub
|  | - |
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification. Wenxuan Huang, Zijie Zhai, Yunhang Shen, Shaosheng Cao, Fei Zhao, Xiangfeng Xu, Zheyu Ye, Yao Hu, Shaohui Lin | 2024/12 | GitHub Model-7B Model-13B |  |    |
[![Star](https://img.shields.io/github/stars/apple/ml-fastvlm.svg?style= | | | | |