This repository contains low-bit quantization papers from 2020 to 2026 on top conference.
221
30 commits
updated Aug 22, 2026
This repository contains low-bit quantization papers from 2020 to 2026.
ICLR 2026 Channel-Aware Mixed-Precision Quantization for Efficient Long-Context Inference
ICLR 2026 CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
ICLR 2026 QeRL: Beyond Efficiency - Quantization-enhanced Reinforcement Learning for LLMs [code]
ICLR 2026 AutoQVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
ICLR 2026 Achieving low-bit Muon through subspace preservation and grid quantization
ICLR 2026 Shift-and-Sum Quantization for Visual Autoregressive Models
ICLR 2026 Inlier-Centric Post-Training Quantization for Object Detection Models
ICLR 2026 Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees
ICLR 2026 BBQ: Boosting Quantization Entropy with Bell Box Quantization
ICLR 2026 Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations [code]
ICLR 2026 Learning under Quantization for High-Dimensional Linear Regression
ICLR 2026 On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs
ICLR 2026 Bridging the Gap Between Promise and Performance for FP4 Quantization [code]
ICLR 2026 KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models [code]
ICLR 2026 ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
ICLR 2026 Post-Training Quantization for Video Matting [code]
ICLR 2026 Tequila: Deadzone-free Ternary Quantization for Large Language Models [code]
ICLR 2026 Q&C: When Quantization Meets Cache in Efficient Generation
ICLR 2026 LogART: Pushing the Limit of Efficient Logarithmic Post-Training Quantization
ICLR 2026 Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models [code]
ICLR 2026 SliderQuant: Accurate Post-Training Quantization for LLMs
ICLR 2026 AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs [code]
ICLR 2026 UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs [code]
ICLR 2026 The Lattice Geometry of Neural Network Quantization: A Short Equivalence Proof of GPTQ and Babai's algorithm
ICLR 2026 DPQuant: Efficient and Private Model Training via Dynamic Quantization Scheduling
ICLR 2026 Towards Quantization-Aware Training for Ultra-Low-Bit Reasoning LLMs
ICLR 2026 A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization
ICLR 2026 Training Dynamics Impact Post-Training Quantization Robustness [code]
ICLR 2026 SSDi8: Accurate and Efficient 8-bit Quantization for State Space Duality
ICLR 2026 The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm
ICLR 2026 PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models [code]
ICLR 2026 Inlier-Centric Post-Training Quantization for Object Detection Models
ICLR 2026 QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models [code]
ICLR 2026 Gradient-Aligned Calibration for Post-Training Quantization of Diffusion Models
ICLR 2026 SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization
ICLR 2026 Compute-Optimal Quantization-Aware Training
ICLR 2026 PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs [code]
ICLR 2026 Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs [code]
ICLR 2026 Beyond Outliers: A Study of Optimizers Under Quantization
ICLR 2026 Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization
ICLR 2026 MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models [code]
ICLR 2026 TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
ICLR 2026 DVD-Quant: Data-free Video Diffusion Transformers Quantization [code]
ICLR 2026 Beyond Uniformity: Sample and Frequency Meta Weighting for Post-Training Quantization of Diffusion Models
ICLR 2026 Rethinking Residual Errors in Compensation-based LLM Quantization
ICLR 2026 SPR²Q: Static Priority-based Rectifier Routing Quantization for Image Super-Resolution [code]
ICLR 2026 STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
ICLR 2026 PT²-LLM: Post-Training Ternarization for Large Language Models [code]
CVPR 2026 Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
CVPR 2026 Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients [code]
CVPR 2026 MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
CVPR 2026 SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models
CVPR 2026 VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models
CVPR 2026 Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights
CVPR 2026 Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution
CVPR 2026 DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing
CVPR 2026 LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers
CVPR 2026 QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models [code]
CVPR 2026 TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
CVPR 2026 S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations
CVPR 2026 Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
CVPR 2026 FraQAT: Quantization Aware Training with Fractional Bits
CVPR 2026 Sampling-Aware Quantization for Diffusion Models
CVPR 2026 D4C: Data-Free Quantization for Contrastive Language-Image Pre-Training Models [code]
CVPR 2026 CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model
CVPR 2026 QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
CVPR 2026 Modality-Aware Bit Allocation for Mixed-Precision Quantization of Vision-Language Models
CVPR 2026 BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers [code]
ICML 2026 LO-BCQ: Locally Optimal Block Clustered Quantization for 4-bit (W4A4) LLM Inference
ICML 2026 ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training
ICML 2026 MixQuant: Pushing the Limits of Block Rotations in Post-Training Quantization
ICML 2026 S-Quant: Rethinking Weight Quantization with Seed-Based Generation
ICML 2026 BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models
ICML 2026 No Retraining at Edge: Efficient Resource-Aware Mixed-Precision Quantization via Federated Supernet Learning
ICML 2026 WaterSIC: Information-Theoretically (Near) Optimal Linear Layer Quantization
ICML 2026 Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
ICML 2026 High-Dimensional Learning Dynamics of Quantized Models with Straight-Through Estimator
ICML 2026 LiftQuant: Continuous Bit-Width Control for Pareto-Optimal LLM Deployment [code]
ICML 2026 Block Rotation is All You Need for MXFP4 Quantization
ICML 2026 AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning
ICML 2026 1-Bit Wonder: Improving QAT Performance in the Low-Bit Regime through K-Means Quantization
ICML 2026 Attn-QAT: 4-Bit Attention With Quantization-Aware Training
ICML 2026 AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs
ICML 2026 ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation
ICML 2026 NanoQuant: Efficient Sub-1-bit Quantization of Large Language Models
ICML 2026 Proteus: Lookup-Free Trellis-Coded Quantization by Lattice-Breaking Compute Codes for 2-Bit LLMs
ICML 2026 WinQ: Accelerating Quantization-Aware Training of Large Language Models around Saddle Points [code]
ICML 2026 Toward Safe Quantization-Aware Fine-tuning: Understanding and Mitigating Safety Alignment Degradation
ICML 2026 Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
ICML 2026 GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
ICML 2026 ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression
ICML 2026 STLA: Spatiotemporal Lookahead Alignment for Post-Training Quantization
ICML 2026 FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models
ICML 2026 TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling
ICML 2026 LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs
ICML 2026 DLLMQuant: A Post-Training Quantization Framework Tailored for Diffusion-Based Large Language Models
ICML 2026 SHARP-Q: Spectral Hessian Alignment and Rectification for Post-training Quantization
ICML 2026 Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers
ICML 2026 TWLA: Breaking the Barrier to W1.58A4 Post-Training Quantization for LLMs
ICML 2026 FPTQuant: Function-Preserving Transforms for LLM Quantization
ICML 2026 INT vs. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats [code]
ICML 2026 Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
ICML 2026 Scaling Law for Quantization-Aware Training
ICML 2026 Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion Models
ICML 2026 Condition Number Based Low-Bit Quantization for Image Super-Resolution [code]
ICML 2026 ECO: Quantized Training without Full-Precision Master Weights
ICML 2026 LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs
ICML 2026 RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization [code]
ICML 2026 QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs
ICML 2026 TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization
ICML 2026 NeUQI: Near-Optimal Uniform Quantization Parameter Initialization for Low-Bit LLMs
ICML 2026 VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
ICML 2026 Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization [code]
ICML 2026 OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
ICML 2026 Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling [code]
ICML 2026 SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights [code]
ICML 2026 Dissecting Quantization Error: A Concentration-Alignment Perspective
ICML 2026 Principled SVD-based Delta Compression via Quantization Error Minimization
ICML 2026 PatternKV: Flattening KV Representation Expands Quantization Headroom
ICML 2026 GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
ICML 2026 WUSH: Near-Optimal Adaptive Transforms for LLM Quantization [code]
ICML 2026 LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization
ICML 2026 LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution [code]
ICML 2026 CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
ICML 2026 Precision-Induced Miscalibration: Understanding and Correcting Confidence Distortion in Quantized Neural Networks
ICML 2026 CoCoQuant: Breaking the Bandwidth Wall via Co-Optimized Communication and Computation Quantization
ICML 2026 RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference
ICML 2026 ImpQuant: Fine-Grained Importance-Aware Quantization for Large Vision-Language Models
ICML 2026 Absorbing Quantization Error by Deformable Noise Scheduler for Diffusion Models
ICML 2026 PsumQuant: In-line Post-training Partial Sum Quantizer for Energy Efficient NPU Inference
ICML 2026 Towards Sub-second Biological Foundation Model Infrastructure: A Quantized Consistency Diffusion Framework for Molecular Docking
ICML 2026 MixFP4: Extending NVFP4 to Mixed Micro-Format via Scale-Bit Reuse and Tensor Core Co-design
AAAI 2026 InfoQ: Mixed-Precision Quantization via Global Information Flow
AAAI 2026 BIQ: Bisection Interval Quantization for Communication-efficient Federated Learning
AAAI 2026 Bi-VLM: Binary Post-Training Quantization for Vision-Language Models
AAAI 2026 BD-Net: Has Depth-Wise Convolution Ever Been Applied in Binary Neural Networks?
NeurIPS 2025 QBasicVSR: Temporal Awareness Adaptation Quantization for Video Super-Resolution
NeurIPS 2025 ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
NeurIPS 2025 Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization
NeurIPS 2025 DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
NeurIPS 2025 Point4Bit: Post Training 4-bit Quantization for Point Cloud 3D Detection
NeurIPS 2025 Binary Quadratic Quantization: Beyond First-Order Quantization for Real-Valued Matrix Compression
NeurIPS 2025 PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement [code]
NeurIPS 2025 VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers
NeurIPS 2025 LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [code]
NeurIPS 2025 LittleBit: Ultra Low-Bit Quantization via Latent Factorization
NeurIPS 2025 HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs
NeurIPS 2025 Efficient Multi-bit Quantization Network Training via Weight Bias Correction and Bit-wise Coreset Sampling
NeurIPS 2025 Efficient and Generalizable Mixed-Precision Quantization via Topological Entropy
NeurIPS 2025 QSCA: Quantization with Self-Compensating Auxiliary for Monocular Depth Estimation
NeurIPS 2025 Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
ICCV 2025 Scheduling Weight Transitions for Quantization-Aware Training [code]
ICCV 2025 Task-Specific Zero-shot Quantization-Aware Training for Object Detection [code]
ICCV 2025 OuroMamba: A Data-Free Quantization Framework for Vision Mamba
ICCV 2025 Allowing Oscillation Quantization: Overcoming Solution Space Limitation in Low Bit-Width Quantization [code]
ICCV 2025 FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform Quantization [code]
ICCV 2025 Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers [code]
ICCV 2025 QuantCache: Adaptive Importance-Guided Quantization with Hierarchical Latent and Layer Caching for Video Generation [code]
ICCV 2025 MixA-Q: Revisiting Activation Sparsity for Vision Transformers from a Mixed-Precision Quantization Perspective
ICCV 2025 DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization [code]
ICCV 2025 AHCPTQ: Accurate and Hardware-Compatible Post-Training Quantization for Segment Anything Model
ICCV 2025 MSQ: Memory-Efficient Bit Sparsification Quantization
ICCV 2025 QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning [code]
ICML 2025 MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design [code]
ICML 2025 Learning from Loss Landscape: Generalizable Mixed-Precision Quantization via Adaptive Sharpness-Aware Gradient Aligning
ICML 2025 ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [code]
ICML 2025 SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [code]
ICML 2025 PARQ: Piecewise-Affine Regularized Quantization [code]
ICML 2025 Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models [code]
ICML 2025 LRA-QViT: Integrating Low-Rank Approximation and Quantization for Robust and Efficient Vision Transformers
ICML 2025 BoA: Attention-aware Post-training Quantization without Backpropagation
ICML 2025 MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance [code]
ICML 2025 NestQuant: nested lattice quantization for matrix products and LLMs
ICML 2025 FlatQuant: Flatness Matters for LLM Quantization [code]
ICML 2025 Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models [code]
ICML 2025 SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression [code]
ICML 2025 QT-DoG: Quantization-Aware Training for Domain Generalization [code]
ICML 2025 Matryoshka Quantization
ICML 2025 Merge-Friendly Post-Training Quantization for Multi-Target Domain Adaptation [code]
ICML 2025 Modulated Diffusion: Accelerating Generative Modeling with Modulated Quantization [code]
ICML 2025 Layer-wise Quantization for Quantized Optimistic Dual Averaging
ICML 2025 Outlier-Aware Post-Training Quantization for Discrete Graph Diffusion Models
ICML 2025 BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference
ICML 2025 GPTAQ: Efficient Finetuning-Free Quantization with Asymmetric Calibration [code]
ICML 2025 Optimizing Large Language Model Training Using FP4 Quantization
ICML 2025 SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
ICML 2025 SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization [code]
ICML 2025 Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers [code]
ICML 2025 GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models [code]
ICML 2025 GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance [code]
AAAI 2025 Qua$^2$SeDiMo: Quantifiable Quantization Sensitivity of Diffusion Models [code]
AAAI 2025 Thinking in Granularity: Dynamic Quantization for Image Super-Resolution by Intriguing Multi-Granularity Clues [code]
AAAI 2025 D2-DPM: Dual Denoising for Quantized Diffusion Probabilistic Models [code]
AAAI 2025 MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models [code]
CVPR 2025 Quantization without Tears
CVPR 2025 APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformer [code]
ICLR 2025 SpinQuant: LLM quantization with learned rotations [code]
ICLR 2025 LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
ICLR 2025 CBQ: Cross-Block Quantization for Large Language Models
ICLR 2025 OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting [code]
ICLR 2025 QERA: an Analytical Framework for Quantization Error Reconstruction [code]
ICLR 2025 Svdquant: Absorbing outliers by low-rank components for 4-bit diffusion models [code]
ICLR 2025 DGQ: Distribution-Aware Group Quantization for Text-to-Image Diffusion Models [code]
ICLR 2025 SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning [code]
ICLR 2025 ViDiT-Q: Efficient and accurate quantization of diffusion transformers for image and video generation [code]
This repository contains low-bit quantization papers from 2020 to 2026 on top conference.
221
30 commits
updated Aug 22, 2026
This repository contains low-bit quantization papers from 2020 to 2026.
ICLR 2026 Channel-Aware Mixed-Precision Quantization for Efficient Long-Context Inference
ICLR 2026 CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
ICLR 2026 QeRL: Beyond Efficiency - Quantization-enhanced Reinforcement Learning for LLMs [code]
ICLR 2026 AutoQVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
ICLR 2026 Achieving low-bit Muon through subspace preservation and grid quantization
ICLR 2026 Shift-and-Sum Quantization for Visual Autoregressive Models
ICLR 2026 Inlier-Centric Post-Training Quantization for Object Detection Models
ICLR 2026 Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees
ICLR 2026 BBQ: Boosting Quantization Entropy with Bell Box Quantization
ICLR 2026 Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations [code]
ICLR 2026 Learning under Quantization for High-Dimensional Linear Regression
ICLR 2026 On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs
ICLR 2026 Bridging the Gap Between Promise and Performance for FP4 Quantization [code]
ICLR 2026 KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models [code]
ICLR 2026 ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
ICLR 2026 Post-Training Quantization for Video Matting [code]
ICLR 2026 Tequila: Deadzone-free Ternary Quantization for Large Language Models [code]
ICLR 2026 Q&C: When Quantization Meets Cache in Efficient Generation
ICLR 2026 LogART: Pushing the Limit of Efficient Logarithmic Post-Training Quantization
ICLR 2026 Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models [code]
ICLR 2026 SliderQuant: Accurate Post-Training Quantization for LLMs
ICLR 2026 AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs [code]
ICLR 2026 UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs [code]
ICLR 2026 The Lattice Geometry of Neural Network Quantization: A Short Equivalence Proof of GPTQ and Babai's algorithm
ICLR 2026 DPQuant: Efficient and Private Model Training via Dynamic Quantization Scheduling
ICLR 2026 Towards Quantization-Aware Training for Ultra-Low-Bit Reasoning LLMs
ICLR 2026 A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization
ICLR 2026 Training Dynamics Impact Post-Training Quantization Robustness [code]
ICLR 2026 SSDi8: Accurate and Efficient 8-bit Quantization for State Space Duality
ICLR 2026 The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm
ICLR 2026 PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models [code]
ICLR 2026 Inlier-Centric Post-Training Quantization for Object Detection Models
ICLR 2026 QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models [code]
ICLR 2026 Gradient-Aligned Calibration for Post-Training Quantization of Diffusion Models
ICLR 2026 SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization
ICLR 2026 Compute-Optimal Quantization-Aware Training
ICLR 2026 PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs [code]
ICLR 2026 Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs [code]
ICLR 2026 Beyond Outliers: A Study of Optimizers Under Quantization
ICLR 2026 Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization
ICLR 2026 MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models [code]
ICLR 2026 TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
ICLR 2026 DVD-Quant: Data-free Video Diffusion Transformers Quantization [code]
ICLR 2026 Beyond Uniformity: Sample and Frequency Meta Weighting for Post-Training Quantization of Diffusion Models
ICLR 2026 Rethinking Residual Errors in Compensation-based LLM Quantization
ICLR 2026 SPR²Q: Static Priority-based Rectifier Routing Quantization for Image Super-Resolution [code]
ICLR 2026 STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
ICLR 2026 PT²-LLM: Post-Training Ternarization for Large Language Models [code]
CVPR 2026 Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
CVPR 2026 Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients [code]
CVPR 2026 MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
CVPR 2026 SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models
CVPR 2026 VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models
CVPR 2026 Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights
CVPR 2026 Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution
CVPR 2026 DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing
CVPR 2026 LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers
CVPR 2026 QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models [code]
CVPR 2026 TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
CVPR 2026 S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations
CVPR 2026 Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
CVPR 2026 FraQAT: Quantization Aware Training with Fractional Bits
CVPR 2026 Sampling-Aware Quantization for Diffusion Models
CVPR 2026 D4C: Data-Free Quantization for Contrastive Language-Image Pre-Training Models [code]
CVPR 2026 CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model
CVPR 2026 QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
CVPR 2026 Modality-Aware Bit Allocation for Mixed-Precision Quantization of Vision-Language Models
CVPR 2026 BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers [code]
ICML 2026 LO-BCQ: Locally Optimal Block Clustered Quantization for 4-bit (W4A4) LLM Inference
ICML 2026 ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training
ICML 2026 MixQuant: Pushing the Limits of Block Rotations in Post-Training Quantization
ICML 2026 S-Quant: Rethinking Weight Quantization with Seed-Based Generation
ICML 2026 BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models
ICML 2026 No Retraining at Edge: Efficient Resource-Aware Mixed-Precision Quantization via Federated Supernet Learning
ICML 2026 WaterSIC: Information-Theoretically (Near) Optimal Linear Layer Quantization
ICML 2026 Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
ICML 2026 High-Dimensional Learning Dynamics of Quantized Models with Straight-Through Estimator
ICML 2026 LiftQuant: Continuous Bit-Width Control for Pareto-Optimal LLM Deployment [code]
ICML 2026 Block Rotation is All You Need for MXFP4 Quantization
ICML 2026 AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning
ICML 2026 1-Bit Wonder: Improving QAT Performance in the Low-Bit Regime through K-Means Quantization
ICML 2026 Attn-QAT: 4-Bit Attention With Quantization-Aware Training
ICML 2026 AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs
ICML 2026 ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation
ICML 2026 NanoQuant: Efficient Sub-1-bit Quantization of Large Language Models
ICML 2026 Proteus: Lookup-Free Trellis-Coded Quantization by Lattice-Breaking Compute Codes for 2-Bit LLMs
ICML 2026 WinQ: Accelerating Quantization-Aware Training of Large Language Models around Saddle Points [code]
ICML 2026 Toward Safe Quantization-Aware Fine-tuning: Understanding and Mitigating Safety Alignment Degradation
ICML 2026 Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
ICML 2026 GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
ICML 2026 ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression
ICML 2026 STLA: Spatiotemporal Lookahead Alignment for Post-Training Quantization
ICML 2026 FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models
ICML 2026 TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling
ICML 2026 LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs
ICML 2026 DLLMQuant: A Post-Training Quantization Framework Tailored for Diffusion-Based Large Language Models
ICML 2026 SHARP-Q: Spectral Hessian Alignment and Rectification for Post-training Quantization
ICML 2026 Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers
ICML 2026 TWLA: Breaking the Barrier to W1.58A4 Post-Training Quantization for LLMs
ICML 2026 FPTQuant: Function-Preserving Transforms for LLM Quantization
ICML 2026 INT vs. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats [code]
ICML 2026 Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
ICML 2026 Scaling Law for Quantization-Aware Training
ICML 2026 Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion Models
ICML 2026 Condition Number Based Low-Bit Quantization for Image Super-Resolution [code]
ICML 2026 ECO: Quantized Training without Full-Precision Master Weights
ICML 2026 LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs
ICML 2026 RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization [code]
ICML 2026 QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs
ICML 2026 TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization
ICML 2026 NeUQI: Near-Optimal Uniform Quantization Parameter Initialization for Low-Bit LLMs
ICML 2026 VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
ICML 2026 Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization [code]
ICML 2026 OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
ICML 2026 Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling [code]
ICML 2026 SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights [code]
ICML 2026 Dissecting Quantization Error: A Concentration-Alignment Perspective
ICML 2026 Principled SVD-based Delta Compression via Quantization Error Minimization
ICML 2026 PatternKV: Flattening KV Representation Expands Quantization Headroom
ICML 2026 GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
ICML 2026 WUSH: Near-Optimal Adaptive Transforms for LLM Quantization [code]
ICML 2026 LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization
ICML 2026 LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution [code]
ICML 2026 CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
ICML 2026 Precision-Induced Miscalibration: Understanding and Correcting Confidence Distortion in Quantized Neural Networks
ICML 2026 CoCoQuant: Breaking the Bandwidth Wall via Co-Optimized Communication and Computation Quantization
ICML 2026 RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference
ICML 2026 ImpQuant: Fine-Grained Importance-Aware Quantization for Large Vision-Language Models
ICML 2026 Absorbing Quantization Error by Deformable Noise Scheduler for Diffusion Models
ICML 2026 PsumQuant: In-line Post-training Partial Sum Quantizer for Energy Efficient NPU Inference
ICML 2026 Towards Sub-second Biological Foundation Model Infrastructure: A Quantized Consistency Diffusion Framework for Molecular Docking
ICML 2026 MixFP4: Extending NVFP4 to Mixed Micro-Format via Scale-Bit Reuse and Tensor Core Co-design
AAAI 2026 InfoQ: Mixed-Precision Quantization via Global Information Flow
AAAI 2026 BIQ: Bisection Interval Quantization for Communication-efficient Federated Learning
AAAI 2026 Bi-VLM: Binary Post-Training Quantization for Vision-Language Models
AAAI 2026 BD-Net: Has Depth-Wise Convolution Ever Been Applied in Binary Neural Networks?
NeurIPS 2025 QBasicVSR: Temporal Awareness Adaptation Quantization for Video Super-Resolution
NeurIPS 2025 ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
NeurIPS 2025 Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization
NeurIPS 2025 DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
NeurIPS 2025 Point4Bit: Post Training 4-bit Quantization for Point Cloud 3D Detection
NeurIPS 2025 Binary Quadratic Quantization: Beyond First-Order Quantization for Real-Valued Matrix Compression
NeurIPS 2025 PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement [code]
NeurIPS 2025 VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers
NeurIPS 2025 LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [code]
NeurIPS 2025 LittleBit: Ultra Low-Bit Quantization via Latent Factorization
NeurIPS 2025 HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs
NeurIPS 2025 Efficient Multi-bit Quantization Network Training via Weight Bias Correction and Bit-wise Coreset Sampling
NeurIPS 2025 Efficient and Generalizable Mixed-Precision Quantization via Topological Entropy
NeurIPS 2025 QSCA: Quantization with Self-Compensating Auxiliary for Monocular Depth Estimation
NeurIPS 2025 Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
ICCV 2025 Scheduling Weight Transitions for Quantization-Aware Training [code]
ICCV 2025 Task-Specific Zero-shot Quantization-Aware Training for Object Detection [code]
ICCV 2025 OuroMamba: A Data-Free Quantization Framework for Vision Mamba
ICCV 2025 Allowing Oscillation Quantization: Overcoming Solution Space Limitation in Low Bit-Width Quantization [code]
ICCV 2025 FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform Quantization [code]
ICCV 2025 Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers [code]
ICCV 2025 QuantCache: Adaptive Importance-Guided Quantization with Hierarchical Latent and Layer Caching for Video Generation [code]
ICCV 2025 MixA-Q: Revisiting Activation Sparsity for Vision Transformers from a Mixed-Precision Quantization Perspective
ICCV 2025 DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization [code]
ICCV 2025 AHCPTQ: Accurate and Hardware-Compatible Post-Training Quantization for Segment Anything Model
ICCV 2025 MSQ: Memory-Efficient Bit Sparsification Quantization
ICCV 2025 QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning [code]
ICML 2025 MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design [code]
ICML 2025 Learning from Loss Landscape: Generalizable Mixed-Precision Quantization via Adaptive Sharpness-Aware Gradient Aligning
ICML 2025 ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [code]
ICML 2025 SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [code]
ICML 2025 PARQ: Piecewise-Affine Regularized Quantization [code]
ICML 2025 Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models [code]
ICML 2025 LRA-QViT: Integrating Low-Rank Approximation and Quantization for Robust and Efficient Vision Transformers
ICML 2025 BoA: Attention-aware Post-training Quantization without Backpropagation
ICML 2025 MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance [code]
ICML 2025 NestQuant: nested lattice quantization for matrix products and LLMs
ICML 2025 FlatQuant: Flatness Matters for LLM Quantization [code]
ICML 2025 Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models [code]
ICML 2025 SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression [code]
ICML 2025 QT-DoG: Quantization-Aware Training for Domain Generalization [code]
ICML 2025 Matryoshka Quantization
ICML 2025 Merge-Friendly Post-Training Quantization for Multi-Target Domain Adaptation [code]
ICML 2025 Modulated Diffusion: Accelerating Generative Modeling with Modulated Quantization [code]
ICML 2025 Layer-wise Quantization for Quantized Optimistic Dual Averaging
ICML 2025 Outlier-Aware Post-Training Quantization for Discrete Graph Diffusion Models
ICML 2025 BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference
ICML 2025 GPTAQ: Efficient Finetuning-Free Quantization with Asymmetric Calibration [code]
ICML 2025 Optimizing Large Language Model Training Using FP4 Quantization
ICML 2025 SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
ICML 2025 SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization [code]
ICML 2025 Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers [code]
ICML 2025 GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models [code]
ICML 2025 GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance [code]
AAAI 2025 Qua$^2$SeDiMo: Quantifiable Quantization Sensitivity of Diffusion Models [code]
AAAI 2025 Thinking in Granularity: Dynamic Quantization for Image Super-Resolution by Intriguing Multi-Granularity Clues [code]
AAAI 2025 D2-DPM: Dual Denoising for Quantized Diffusion Probabilistic Models [code]
AAAI 2025 MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models [code]
CVPR 2025 Quantization without Tears
CVPR 2025 APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformer [code]
ICLR 2025 SpinQuant: LLM quantization with learned rotations [code]
ICLR 2025 LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
ICLR 2025 CBQ: Cross-Block Quantization for Large Language Models
ICLR 2025 OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting [code]
ICLR 2025 QERA: an Analytical Framework for Quantization Error Reconstruction [code]
ICLR 2025 Svdquant: Absorbing outliers by low-rank components for 4-bit diffusion models [code]
ICLR 2025 DGQ: Distribution-Aware Group Quantization for Text-to-Image Diffusion Models [code]
ICLR 2025 SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning [code]
ICLR 2025 ViDiT-Q: Efficient and accurate quantization of diffusion transformers for image and video generation [code]