| D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration | 2026 | CVPR |  |
| Budget-Constrained Step-Level Diffusion Caching | 2026 | ICML |  |
| ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training | 2026 | ICML |  |
| Distribution Matching Distillation Meets Reinforcement Learning | 2026 | ECCV |  |
| DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation | 2026 | ICLR |  |
| Parallel Decoding Distillation for Fast Image and Video Generation | 2026 | None |  |
| Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification | 2026 | None |  |
| SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation | 2026 | None |  |
| OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers | 2026 | None |  |
| Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling | 2026 | None |  |
| Post-Training Pruning for Diffusion Transformers | 2026 | None |  |
| Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation | 2026 | None |  |
| Training-free sparse attention based on cumulative energy filtering | 2026 | None |  |
| Adaptive Inference-Time Scaling via Early-Step Latent Verification for Image Editing | 2026 | None |  |
| HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing | 2026 | None |  |
| TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment | 2026 | None |  |
| High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation | 2026 | None |  |
| RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling | 2026 | None |  |
| ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE | 2026 | None |  |
| Qwen-Image-Flash: Beyond Objective Design | 2026 | None |  |
| KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks | 2026 | None |  |
| Dual-Rate Diffusion: Accelerating diffusion models with an interleaved heavy-light network | 2026 | None |  |
| ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices | 2026 | None |  |
| Continuous-Time Distribution Matching for Few-Step Diffusion Distillation | 2026 | None |  |
| Statistically-Lossless Quantization of Large Language Models | 2026 | None |  |
| YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal | 2026 | CVPR |  |
| Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models | 2026 | CVPR |  |
| MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models | 2026 | CVPR |  |
| SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models | 2026 | CVPR |  |
| ResCa: Residual Caching for Diffusion Transformers Acceleration | 2026 | CVPR |  |
| DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching | 2026 | CVPR |  |
| SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching | 2026 | CVPR |  |
| Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep | 2026 | CVPR |  |
| d2Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching | 2026 | CVPR |  |
| Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models | 2026 | CVPR |  |
| LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation | 2026 | CVPR |  |
| An Efficient Token Compression Framework for Visual Object Tracking | 2026 | CVPR |  |
| VMonarch: Efficient Video Diffusion Transformers with Structured Attention | 2026 | CVPR |  |
| Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism | 2026 | CVPR |  |
| NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration | 2026 | CVPR |  |
| Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning | 2026 | CVPR |  |
| Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding | 2026 | CVPR |  |
| Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer | 2026 | CVPR |  |
| Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers | 2026 | CVPR |  |
| Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights | 2026 | CVPR |  |
| LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning | 2026 | CVPR | |
| S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain | 2026 | CVPR |  |
| vAttention: Verified Sparse Attention via Sampling | 2026 | ICLR |  |
| PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models | 2026 | ICLR |  |
| How to train data-efficient LLMs | 2026 | ICLR |  |
| ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion | 2026 | ICLR |  |
| Fewer Battles, More Gain: An Information-Efficient Framework for Arena-based LLM Evaluation | 2026 | ICLR |  |
| PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery | 2026 | ICLR |  |
| Efficient Orthogonal Fine-Tuning with Principal Subspace Adaptation | 2026 | ICLR |  |
| MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models | 2026 | ICLR |  |
| Fast-dLLM v2: Efficient Block-Diffusion LLM | 2026 | ICLR |  |
| DSA: Efficient Inference For Video Generation Models via Distributed Sparse Attention | 2026 | ICLR |  |
| Q&C: When Quantization Meets Cache in Efficient Generation | 2026 | ICLR |  |
| Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning Large Language Models | 2026 | ICLR |  |
| Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling | 2026 | ICLR |  |
| GradPruner: Gradient-guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs | 2026 | ICLR |  |
| ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping | 2026 | ICLR |  |
| Channel-Aware Mixed-Precision Quantization for Efficient Long-Context Inference | 2026 | ICLR |  |
| Test-Time Iterative Error Correction for Efficient Diffusion Models | 2026 | ICLR |  |
| FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring | 2026 | ICLR |  |
| PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation | 2026 | ICLR |  |
| Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs | 2026 | ICLR |  |
| SPRINT: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers | 2026 | ICLR |  |
| ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference | 2026 | ICLR |  |
| FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion | 2026 | ICLR |  |
| SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer | 2026 | ICLR |  |
| Diffusion Models as Dataset Distillation Priors | 2026 | ICLR |  |
| Scale-wise Distillation of Diffusion Models | 2026 | ICLR |  |
| Streaming Autoregressive Video Generation via Diagonal Distillation | 2026 | ICLR |  |
| pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation | 2026 | ICLR |  |
| PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers | 2026 | ICML |  |
| Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models | 2026 | None |  |
| RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion | 2026 | CVPR |  |
| AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation | 2026 | None |  |
| Towards Resource-Efficient LLMs: End-to-End Energy Accounting of Distillation Pipelines | 2026 | ICML |  |
| Spectral Progressive Diffusion for Efficient Image and Video Generation | 2026 | None |  |
| SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer | 2026 | None |  |
| Sparser, Faster, Lighter Transformer Language Models | 2026 | None |  |
| Stream-T1: Test-Time Scaling for Streaming Video Generation | 2026 | None |  |
| Optimizing Few-Step Generation with Adaptive Matching Distillation | 2026 | ICML |  |
| Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding | 2026 | None |  |
| Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs | 2026 | None |  |
| Where Do the Joules Go? Diagnosing Inference Energy Consumption | 2026 | None |  |
| Generative Modeling via Drifting | 2026 | None |  |
| Just on Time: Token-Level Early Stopping for Diffusion Language Models | 2026 | None |  |
| From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution | 2026 | None |  |
| Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers | 2026 | None |  |
| ArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow Distillation | 2026 | None |  |
| FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching | 2026 | None |  |
| Learning to Reason in 13 Parameters | 2026 | None |  |
| Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization | 2026 | None |  |
| PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion | 2026 | None |  |
| Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing | 2026 | None | |
| Iterative Refinement Improves Compositional Image Generation | 2026 | None |  |
| LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation | 2025 | None |  |
| CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models | 2025 | None |  |
| Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance | 2025 | None |  |
| ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation | 2025 | None | |
| Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models | 2025 | None |  |
| SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer | 2025 | None |  |
| SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization | 2025 | None |  |
| Less is More: Recursive Reasoning with Tiny Networks | 2025 | None |  |
| Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models | 2025 | None |  |
| Optimal Stepsize for Diffusion Sampling | 2025 | None |  |
| VORTA: Efficient Video Diffusion via Routing Sparse Attention | 2025 | NeurIPS |  |
| VSA: Faster Video Diffusion with Trainable Sparse Attention | 2025 | NeurIPS |  |
| Efficient Reasoning Models: A Survey | 2025 | None |  |
| pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation | 2025 | ICLR |  |
| REAP the Experts: Why Pruning Prevails for One-Shot MoE compression | 2025 | None |  |
| LLaDA2.0: Scaling Up Diffusion Language Models to 100B | 2025 | None | |
| TiDAR: Think in Diffusion, Talk in Autoregression | 2025 | None |  |
| HilbertA: Hilbert Attention for Image Generation with Diffusion Models | 2025 | None |  |
| Intelligence per Watt: Measuring Intelligence Efficiency of Local AI | 2025 | None |  |
| LongVie 2: Multimodal Controllable Ultra-Long Video World Model | 2025 | None | |
| HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming | 2025 | None |  |
| MAGI-1: Autoregressive Video Generation at Scale | 2025 | None | |
| WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference | 2025 | None |  |
| Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation | 2025 | None |  |
| H-Net++: Hierarchical Dynamic Chunking for Tokenizer-Free Language Modelling in Morphologically-Rich Languages | 2025 | None | |
| Circuit Sparsity | 2025 | None |  |
| SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression | 2024 | None |  |
| TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs | 2025 | NeurIPS |  |
| Frequency-Aware Token Reduction for Efficient Vision Transformer | 2025 | NeurIPS |  |
| Language Models (Mostly) Know When to Stop Reading | 2025 | NeurIPS |  |
| Why 1 + 1 < 1 in Visual Token Pruning | 2025 | NeurIPS |  |
| Don’t Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models | 2025 | NeurIPS |  |
| The Overthinker’s DIET: Cutting Token Calories with Difficulty-Aware Training | 2025 | NeurIPS |  |
| R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing | 2025 | NeurIPS |  |
| Training Language Models to Reason Efficiently | 2025 | NeurIPS |  |
| AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models | 2025 | NeurIPS |  |
| FP4 All the Way: Fully Quantized Training of LLMs | 2025 | NeurIPS |  |
| Quartet: Native FP4 Training Can Be Optimal for Large Language Models | 2025 | NeurIPS |  |
| DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization | 2025 | NeurIPS |  |
| DFloat11: Lossless Compression of LLMs and Diffusion Models for Efficient GPU Inference | 2024 | NeurIPS |  |
| A Token is Worth over 1,000 Tokens | 2025 | NeurIPS |  |
| HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance | 2025 | NeurIPS | |
| One-Step Diffusion-Based Image Compression with Semantic Distillation | 2025 | NeurIPS |  |
| Mean Flows for One-step Generative Modeling | 2025 | NeurIPS | |
| Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction | 2025 | NeurIPS | |
| Simple Distillation for One-Step Diffusion Models | 2025 | NeurIPS |  |
| Why Knowledge Distillation Works in Generative Models | 2025 | NeurIPS |  |
| Knowledge Distillation Detection for Open-Weights Models | 2025 | NeurIPS |  |
| FFN Fusion: Rethinking Sequential Computation in Large Language Models | 2024 | NeurIPS |  |
| Sign-In to the Lottery: Reparameterized Sparse Training | 2025 | NeurIPS |  |
| Differentiable Sparsity via D-Gating | 2025 | NeurIPS |  |
| The Graphon Limit Hypothesis | 2025 | NeurIPS |  |
| Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization | 2025 | NeurIPS |  |
| DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs | 2025 | NeurIPS |  |
| Spark Transformer: Reactivating Sparsity in FFN and Attention | 2025 | NeurIPS |  |
| Multi-Token Prediction Needs Registers | 2025 | NeurIPS |  |
| Q3R: Quadratic Reweighted Rank Regularizer for Effective Low-Rank Training | 2025 | NeurIPS |  |
| Accurate and Efficient Low-Rank Model Merging in Core Space | 2025 | NeurIPS |  |
| FALQON: Accelerating LoRA Fine-tuning with Low-Bit Floating-Point Arithmetic | 2025 | NeurIPS |  |
| DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models | 2025 | NeurIPS |  |
| KLASS: KL-Guided Fast Inference in Masked Diffusion Models | 2025 | NeurIPS |  |
| ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion | 2025 | NeurIPS |  |
| AI Should Sense Better, Not Just Scale Bigger: Adaptive Sensing as a Paradigm Shift | 2025 | NeurIPS |  |
| A Sustainable AI Economy Needs Data Deals That Work for Generators | 2024 | NeurIPS |  |
| We Should Chart an Atlas of All the World's Models | 2024 | NeurIPS | |
| Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models | 2025 | NeurIPS |  |
| Position: Require Frontier AI Labs To Release Small "Analog" Models | 2025 | NeurIPS |  |
| Accelerating Diffusion LLMs via Adaptive Parallel Decoding | 2025 | NeurIPS |  |
| LongLive: Real-time Interactive Long Video Generation | 2025 | None |  |
| MagCache: Fast Video Generation with Magnitude-Aware Cache | 2025 | NeurIPS |  |
| Toward Efficient Inference for Mixture of Experts | 2025 | NeurIPS | |
| Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization | 2025 | NeurIPS |  |
| DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder | 2025 | None | |
| Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation | 2025 | NeurIPS | |
| More than Carbon: Cradle-to-Grave environmental impacts of GenAI training on the Nvidia A100 GPU | 2025 | None |  |
| Does Efficiency Lead to Green Machine Learning Model Training? Analyzing Historical Trends in Impacts from Hardware, Algorithmic and Carbon Optimizations | 2025 | None |  |
| Measuring the environmental impact of delivering AI at Google Scale | 2025 | None |  |
| GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models | 2025 | ICML |  |
| Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation | 2025 | None |  |
| HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching | 2025 | ICML |  |
| ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion | 2025 | None |  |
| DiCache: Let Diffusion Model Determine its Own Cache | 2025 | None |  |
| Set Block Decoding is a Language Model Inference Accelerator | 2025 | None | |
| Position: Small Language Models are the Future of Agentic AI | 2025 | None | |
| Fast-dLLM v2: Efficient Block-Diffusion Large Language Model | 2025 | None | |
| SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation | 2025 | None | |
| LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models | 2025 | None | |
| Let LLM Tell What to Prune and How Much to Prune | 2025 | ICML |  |
| SlimLLM: Accurate Structured Pruning for Large Language Models | 2025 | ICML |  |
| Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation | 2025 | ICML |  |
| OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference | 2025 | ICML | |
| SkipGPT: Each Token is One of a Kind | 2025 | ICML |  |
| AdaSplash: Adaptive Sparse Flash Attention | 2025 | ICML | |
| Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression | 2025 | ICML | |
| An Efficient Matrix Multiplication Algorithm for Accelerating Inference in Binary and Ternary Neural Networks | 2025 | ICML | |
| Accelerating Large Language Model Reasoning via Speculative Search | 2025 | ICML |  |
| ReFrame: Layer Caching for Accelerated Inference in Real-Time Rendering | 2025 | ICML |  |
| HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration | 2025 | ICML |  |
| Attention-Level Speculation | 2025 | ICML |  |
| EvoPress: Accurate Dynamic Model Compression via Evolutionary Search | 2025 | ICML | |
| Hardware and Software Platform Inference | 2025 | ICML |  |
| MoH: Multi-Head Attention as Mixture-of-Head Attention | 2025 | ICML | |
| QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration | 2025 | ICML | |
| KV Cache Compression via Sparse Coding over Universal Dictionaries | 2025 | ICML |  |
| KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference | 2025 | ICML |  |
| BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference | 2025 | ICML |  |
| any4: Learned 4-bit Numeric Representation for LLMs | 2025 | ICML |  |
| AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism | 2025 | ICML |  |
| BOA: Attention-aware Post-training Quantization without Backpropagation | 2025 | ICML |  |
| Radio: Rate–Distortion Optimization for Large Language Model Compression | 2025 | ICML |  |
| Auditing Prompt Caching in Language Model APIs | 2025 | ICML | |
| Mind the Gap: A Practical Attack on GGUF Quantization | 2025 | ICML |  |
| Olica: Efficient Structured Pruning of Large Language Models without Retraining | 2025 | ICML |  |
| TESS 2: A Large-Scale Generalist Diffusion Language Model | 2025 | None | |
| Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference | 2025 | None | |
| Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential | 2025 | None | |
| The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries | 2025 | None | |
| QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models | 2025 | None |  |
| Fast Video Generation with Sliding Tile Attention | 2025 | ICML | |
| Quartet: Native FP4 Training Can Be Optimal for Large Language Models | 2025 | None |  |
| How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference | 2025 | None |  |
| MagCache: Fast Video Generation with Magnitude-Aware Cache | 2025 | None |  |
| Compressing Language Models for Specialized Domains | 2025 | None | |
| Dynamic Chunking for End-to-End Hierarchical Sequence Modeling | 2025 | None | |
| SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training | 2025 | None | |
| XAttention: Block Sparse Attention with Antidiagonal Scoring | 2025 | ICML | |
| Jenga: Effective Memory Management for Serving LLM with Heterogeneity | 2025 | None | |
| Learning Few-Step Diffusion Models by Trajectory Distribution Matching | 2025 | ICCV | |
| Radial Attention: O(nlogn) Sparse Attention with Energy Decay for Long Video Generation | 2025 | None | |
| Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding | 2025 | None |  |
| Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas | 2025 | None |  |
| Mirage: A Multi-Level Superoptimizer for Tensor Programs | 2025 | None | |
| The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization | 2025 | None |  |
| AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse | 2025 | None |  |
| Hardware-Efficient Attention for Fast Decoding | 2025 | None |  |
| Model-Preserving Adaptive Rounding | 2025 | None |  |
| Frugal AI: Introduction, Concepts, Development and Open Questions | 2025 | None |  |
| Making AI Less “Thirsty”: Uncovering and Addressing the Secret Water Footprint of AI Models | 2025 | None |  |
| Efficient Time Series Processing for Transformers and State-Space Models through Token Merging | 2025 | None | |
| A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency | 2025 | None |  |
| SpargeAttn: Accurate Sparse Attention Accelerating Any Model Inference | 2025 | None |  |
| SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning | 2025 | None |  |
| s1: Simple test-time scaling | 2025 | None |  |
| BitNet b1.58 2B4T Technical Report | 2025 | None |  |
| NdLinear Is All You Need for Representation Learning | 2025 | None |  |
| LoRI: Reducing Cross-Task Interference in Multi-Task LowRank Adaptation | 2025 | ICLR |  |
| FISH-Tuning: Enhancing PEFT Methods with Fisher Information | 2025 | None |  |
| Green Prompting | 2025 | None | |
| Compression Scaling Laws:Unifying Sparsity and Quantization | 2025 | None |   |
| FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality | 2025 | ICLR |  |
| LANTERN: Accelerating Visual Autoregressive Models with Relaxed Speculative Decoding | 2025 | ICLR |  |
| Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models | 2025 | None |  |
| Real-Time Video Generation with Pyramid Attention Broadcast | 2025 | ICLR |  |
| Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion Models | 2025 | ICLR |  |
| Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing | 2025 | ICLR |  |
| Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention | 2025 | None | |
| FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute | 2025 | None | |
| Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling | 2025 | None |  |
| SpinQuant: LLM Quantization with Learned Rotations | 2025 | ICLR |  |
| Making AI Less “Thirsty”: Uncovering and Addressing the Secret Water Footprint of AI Models | 2025 | None | |
| Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps | 2025 | None |  |
| QuEST: Stable Training of LLMs with 1-Bit Weights and Activations | 2025 | None |  |
| Distillation Scaling Laws | 2025 | None |  |
| From Efficiency Gains to Rebound Effects: The Problem of Jevons' Paradox in AI's Polarized Environmental Debate | 2025 | None | |
| Coca4ai: checking energy behaviors on AI data centers | 2024 | None |  |
| Scaling up Masked Diffusion Models on Text | 2024 | None | |
| LTX-Video: Realtime Video Latent Diffusion | 2024 | CVPR | |
| Constant Acceleration Flow | 2024 | None |  |
| LoRA vs Full Fine-tuning: An Illusion of Equivalence | 2024 | NeurIPS |  |
| How Green Can AI Be? A Study of Trends in Machine Learning Environmental Impacts | 2024 | None |  |
| QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs | 2024 | NeurIPS |  |
| The Iterative Optimal Brain Surgeon: Faster Sparse Recovery by Leveraging Second-Order Information | 2024 | NeurIPS | |
| Palu: Compressing KV-Cache with Low-Rank Projection | 2024 | None |  |
| AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration | 2024 | MLSys |  |
| LOFIT: Localized Fine-tuning on LLM Representations | 2024 | NeurIPS |  |
| Outlier Weighed Layerwise Sparsity: A Missing Secret Sauce for Pruning LLMs to High Sparsity | 2024 | ICML |  |
| FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality | 2024 | None |  |
| QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks | 2024 | ICML |  |
| Better & Faster Large Language Models via Multi-token Prediction | 2024 | None | |
| QTIP: Quantization with Trellises and Incoherence Processing | 2024 | NeurIPS |  |
| VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models | 2024 | EMNLP |  |
| QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs | 2024 | NeurIPS |  |
| QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving | 2024 | None |  |
| Extreme Compression of Large Language Models via Additive Quantization | 2024 | ICML |  |
| Fast Matrix Multiplications for Lookup Table-Quantized LLMs | 2024 | None |  |
| GPTVQ: The Blessing of Dimensionality for LLM Quantization | 2024 | None |  |
| Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey | 2024 | None |  |
| SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration | 2024 | None |  |
| SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices | 2024 | NeurIPS |  |
| ShortGPT: Layers in Large Language Models are More Redundant Than You Expecthttps://arxiv.org/pdf/2403.03853 | 2024 | None |  |
| Canvas: End-to-End Kernel Architecture Search in Neural Networks | 2024 | None |  |
| Scaling Laws for Precision | 2024 | None |  |
| DeepCache: Accelerating Diffusion Models for Free | 2024 | CVPR |  |
| Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding | 2024 | ACL |  |
| Power Hungry Processing: Watts Driving the Cost of AI Deployment? | 2024 | FaccT | |
| Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression | 2024 | ICML |   |
| Pushing the Limits of Large Language Model Quantization via the Linearity Theorem | 2024 | None |  |
| Position: Tensor Networks are a Valuable Asset for Green AI | 2024 | None |  |
| Hype, Sustainability, and the Price of the Bigger-is-Better Paradigm in AI | 2024 | None |  |
| Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes | 2024 | ICLR |  |
| Exploring the Carbon Footprint of Hugging Face's ML Models: A Repository Mining Study | 2023 | ESEM |  |
| Efficient Memory Management for Large Language Model Serving with PagedAttention | 2023 | SOSP |  |
| Broken Neural Scaling Laws | 2023 | ICLR | |
| Model Compression in Practice: Lessons Learned from Practitioners Creating On-device Machine Learning Experiences | 2023 | None | |
| Post Training Mixed Precision Quantization of Neural Networks using First-Order Information | 2023 | ICCV |  |
| Ring Attention with Blockwise Transformers for Near-Infinite Context | 2023 | None | |
| A Practical Mixed Precision Algorithm for Post-Training Quantization | 2023 | None |  |
| SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models | 2023 | ICML |  |
| PERP: Rethinking the Prune-Retrain Paradigm in the Era of LLMs | 2023 | None |   |
| Trends in AI inference energy consumption: Beyond the performance-vs-parameter laws of deep learning | 2023 | Sustainable Computing: Informatics and Systems |  |
| An experimental comparison of software-based power meters: focus on CPU and GPU | 2023 | CCGrid |  |
| Fast Inference from Transformers via Speculative Decoding | 2023 | ICML |  |
| Efficient Streaming Language Models with Attention Sinks | 2023 | ICLR | |
| Q-Diffusion: Quantizing Diffusion Models | 2023 | ICCV |  |
| GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers | 2023 | None |  |
| QReg: On Regularization Effects of Quantization | 2022 | None |  |
| Mixed-Precision Neural Network Quantization via Learned Layer-wise Importance | 2022 | ECCV |  |
| Knowledge Distillation: A Good Teacher is Patient and Consistent | 2022 | CVPR |  |
| LoRA: Low-Rank Adaptation of Large Language Models | 2022 | ICLR |  |
| LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale | 2022 | NeurIPS |  |
| Optimal Clipping and Magnitude-aware Differentiation for Improved Quantization-aware Training | 2022 | ICML |  |
| Sustainable AI: Environmental Implications, Challenges and Opportunities | 2022 | None |  |
| Learnable Lookup Table for Neural Network Quantization | 2022 | CVPR |  |
| Training Compute-Optimal Large Language Models | 2022 | None | |
| FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness | 2022 | None | |
| Towards a Unified View of Parameter-Efficient Transfer Learning | 2022 | ICLR |  |
| Parameter-Efficient Transfer Learning with Diff Pruning | 2021 | ACL |   |
| What is the State of Neural Network Pruning? | 2020 | MLSys |  |
| Scaling Laws for Autoregressive Generative Modeling | 2020 | None | |
| Model Compression via Distillation and Quantization | 2018 | ICLR |  |
| Optimal Brain Damage | 1989 | NeurIPs |  |