piesauce/awesome-dLLM-resources

Frequently updated list of dLLM (Diffusion Large Language Models) papers, models, and other resources

Python

55

278 commits

updated Sep 1, 2026

See the code

README

awesome-dLLM-resources

Frequently updated list of dLLM (Diffusion Large Language Models) papers, models, and other resources.

Maintained By Suhas Pai and Xiaojun Ren. For an overview of this field, see our ICLR 2026 blog post.

Make a PR if you want to include your paper on this list or if you've found a cool paper that you think should be included in this list :)

Papers by Category Radar

Libraries

  • dlmserve: First OSS Serving Engine for Diffusion Language Models - May 25, 2026 GitHub
  • DiRL: An Efficient Training Framework for Diffusion Language Models - November 18, 2025 GitHub
  • dLLM: Simple Diffusion Language Modeling - October 11, 2025 GitHub

Models

  • DiffusionGemmaJuly 31, 2026 arXiv
  • Continuous Latent Diffusion Language ModelMay 7, 2026 arXiv
  • W1-4B-dLLM: Whaletech Diffusion LLMApril 13, 2026 Hugging Face Demo
  • LLaDA2.0: Scaling Up Diffusion Language Models to 100BDecember 10, 2025 arXiv
  • Causal Diffusion Language Models - December 4, 2025 Blog Post
  • Soft-Masked Diffusion Language ModelsOctober 20, 2025 arXiv
  • UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language ModelsOctober 12, 2025 arXiv
  • RND1: Simple, Scalable AR-to-Diffusion ConversionOctober 9, 2025 Blog Post
  • SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation - October 7, 2025 arXiv
  • Syntax-Guided Diffusion Language Models with User-Integrated PersonalizationOctober 2, 2025 arXiv
  • CoDA: Coding LM via Diffusion AdaptationSeptember 27, 2025 arXiv
  • LLaDA-MoE: A Sparse MoE Diffusion Language ModelSeptember 25, 2025 arXiv
  • Dream 7B: Diffusion Large Language Models - August 21, 2025 arXiv
  • DiffuCoder: Understanding and Improving Masked Diffusion Models for Code GenerationJune 25, 2025 arXiv
  • Mercury: Ultra-Fast Language Models Based on DiffusionJune 17, 2025 arXiv
  • LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion ModelsMay 25, 2025 arXiv
  • Large Language Diffusion ModelsFebruary 14, 2025 arXiv

Scaling Laws

  • Continuous Diffusion Scales Competitively with Discrete Diffusion for LanguageMay 18, 2026 arXiv
  • Diffusion Language Models Are Super Data LearnersOctober 1, 2025 GitHub
  • Diffusion Beats Autoregressive in Data-Constrained SettingsJuly 21, 2025 arXiv

Architecture & Learning Objectives

  • DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs - May 31, 2026 arXiv
  • WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering - May 30, 2026 arXiv
  • Triplet-Block Diffusion RWKV - May 25, 2026 arXiv
  • DLLM-JEPA: Joint Embedding Predictive Architectures for Masked Diffusion Language Models - May 24, 2026 arXiv
  • DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling - May 22, 2026 arXiv
  • Drifting Objectives for Refining Discrete Diffusion Language Models - May 19, 2026 arXiv
  • Dynamic Chunking for Diffusion Language Models - May 15, 2026 arXiv
  • Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement - May 14, 2026 arXiv
  • BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion - May 12, 2026 arXiv
  • ELF: Embedded Language Flows - May 11, 2026 arXiv
  • How to Train Your Latent Diffusion Language Model Jointly With the Latent Space - May 8, 2026 arXiv
  • TextLDM: Language Modeling with Continuous Latent Diffusion - May 8, 2026 arXiv
  • Token Time Continuous Diffusion for Language Modeling - May 7, 2026 arXiv
  • Towards Closing the Autoregressive Gap in Language Modeling via Entropy-Gated Continuous Bitstream Diffusion - May 7, 2026 arXiv
  • From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons - April 11, 2026 arXiv
  • Beyond Hard Masks: Progressive Token Evolution for Diffusion Language ModelsJanuary 16, 2026 arXiv, Code
  • CANDI: Hybrid Discrete-Continuous Diffusion Models - October 26, 2025 arXiv
  • Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and ArchitectureJune 24, 2025 arXiv

Finetuning/RL

  • Mask-Aware Policy Gradients for Diffusion Language ModelsJuly 16, 2026 arXiv
  • Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language ModelsJune 3, 2026 arXiv
  • Knowledge Editing in Masked Diffusion Language ModelsJune 2, 2026 arXiv
  • Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language ModelsMay 31, 2026 arXiv
  • Learnability-Informed Fine-Tuning of Diffusion Language ModelsMay 21, 2026 arXiv
  • Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language ModelsMay 13, 2026 arXiv
  • Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language ModelsMay 12, 2026 arXiv
  • Relative Score Policy Optimization for Diffusion Language ModelsMay 11, 2026 arXiv
  • DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language ModelsMay 8, 2026 arXiv
  • Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language ModelsMay 8, 2026 arXiv
  • FlowLM: Few-Step Language Modeling via Diffusion-to-Flow AdaptationApril 6, 2026 arXiv
  • Principled RL for Diffusion LLMs Emerges from a Sequence-Level PerspectiveDecember 3, 2025 arXiv
  • Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the WayOctober 28, 2025 arXiv
  • Principled and Tractable RL for Reasoning with Diffusion Language ModelsOctober 5, 2025 arXiv
  • Fine-Tuning Masked Diffusion for Provable Self-CorrectionOctober 1, 2025 arXiv
  • WeFT: Weighted Entropy-Driven Fine-Tuning for dLLMsSeptember 25, 2025 arXiv
  • Inpainting-Guided Policy Optimization for Diffusion Large Language ModelsSeptember 12, 2025 arXiv
  • Revolutionizing Reinforcement Learning Framework for Diffusion Large Language ModelsSeptember 8, 2025 arXiv

Distillation

  • SelFusion: Self-distillation for Diffusion Language ModelsAugust 24, 2026 arXiv
  • Learning from the Self-future: On-policy Self-distillation for dLLMsJune 16, 2026 arXiv, Code
  • Infinite Mask Diffusion for Few-Step DistillationMay 11, 2026 arXiv
  • TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLMMay 10, 2026 arXiv

Reasoning

  • TiDAR: Think in Diffusion, Talk in AutoregressionNovember 12, 2025 arXiv
  • Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy OptimizationOctober 9, 2025 arXiv
  • Improving Reasoning for Diffusion Language Models via Group Diffusion Policy OptimizationOctober 9, 2025 arXiv
  • DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement LearningOctober 2, 2025 arXiv
  • RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free GuidanceSeptember 29, 2025 arXiv
  • Thinking Inside the Mask: In-Place Prompting in Diffusion LLMsAugust 14, 2025 arXiv
  • d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement LearningJune 3, 2025 arXiv

Decoding Strategies

  • Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model InferenceAugust 27, 2026 arXiv
  • Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMsAugust 27, 2026 arXiv
  • Survival-Guided Length Control for Efficient Diffusion Language ModelsAugust 26, 2026 arXiv
  • Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMsAugust 23, 2026 arXiv
  • Length-Adaptive Decoding for Masked Diffusion Machine TranslationAugust 23, 2026 arXiv
  • NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language ModelsJune 4, 2026 arXiv
  • SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMsJune 3, 2026 arXiv
  • Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language ModelsJune 3, 2026 arXiv
  • Supportive Token Revealing for Fast Diffusion Language Model DecodingJune 2, 2026 arXiv
  • DLM-SWAI: Steering Diffusion Language Models Before They UnmaskMay 28, 2026 arXiv
  • When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language ModelsMay 27, 2026 arXiv
  • The Path Matters: Learning a Token-Commitment Policy for Diffusion Language ModelsMay 23, 2026 arXiv
  • Constrained Code Generation with Discrete DiffusionMay 16, 2026 arXiv
  • Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency TeachersMay 16, 2026 arXiv
  • Adaptive Steering and Remasking for Safe Generation in Diffusion Language ModelsMay 13, 2026 arXiv
  • Edit-Based Refinement for Parallel Masked Diffusion Language ModelsMay 10, 2026 arXiv
  • Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language ModelsMay 8, 2026 arXiv
  • When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language ModelsApril 27, 2026 arXiv
  • Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language ModelsApril 20, 2026 arXiv
  • Stability-Weighted Decoding for Diffusion Language ModelsApril 18, 2026 arXiv
  • Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language ModelsApril 6, 2026 arXiv
  • LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language ModelsMarch 24, 2026 arXiv
  • GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language ModelsMarch 4, 2026 arXiv
  • Efficient Self-Evaluation for Diffusion Language Models via Sequence RegenerationMarch 3, 2026 arXiv
  • One Token Is Enough: Improving Diffusion Language Models with a Sink TokenJanuary 27, 2026 arXiv
  • Deferred Commitment Decoding for Diffusion Language Models with Confidence-Aware Sliding WindowsJanuary 5, 2026 arXiv
  • Activation Steering for Masked Diffusion Language ModelsDecember 30, 2025 arXiv
  • ReFusion: A Diffusion Large Language Model with Parallel Autoregressive DecodingDecember 15, 2025 arXiv
  • Beyond Static Cutoffs: One-Shot Dynamic Thresholding for Diffusion Language ModelsNovember 3, 2025 arXiv
  • CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace CreditsOctober 7, 2025 arXiv
  • AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block SizeSeptember 30, 2025 arXiv
  • Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language ModelsSeptember 28, 2025 arXiv
  • Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language ModelsAugust 12, 2025 arXiv
  • Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language ModelsAugust 1, 2025 arXiv
  • Unveiling the Potential of Diffusion Large Language Model in Controllable GenerationJuly 6, 2025 arXiv
  • Remasking Discrete Diffusion Models with Inference-Time ScalingMarch 1, 2025 arXiv

Speculative Decoding

  • SimSD: Simple Speculative Decoding in Diffusion Language ModelsJune 1, 2026 arXiv
  • DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative DecodingJune 1, 2026 arXiv
  • Cost-Aware Diffusion Draft Trees for Speculative DecodingJune 1, 2026 arXiv
  • PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative DecodingMay 15, 2026 arXiv
  • Factorization-Error-Free Discrete Diffusion Language Model via Speculative DecodingMay 14, 2026 arXiv
  • Self-Speculative Decoding for Diffusion Large Language ModelsOctober 5, 2025 arXiv
  • Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative DecodingSeptember 22, 2025 arXiv

Inference Optimization

  • Accelerating Diffusion Language Models via Structured Suffix ModelingAugust 24, 2026 arXiv
  • SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative DecodingJune 3, 2026 arXiv
  • Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM InferenceJune 1, 2026 arXiv, Code, Project Page
  • EPIC: Efficient and Parallel Inference under CFG Constraints for Diffusion Language ModelsMay 30, 2026 arXiv
  • Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence ExtrapolationMay 29, 2026 arXiv
  • PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language ModelsMay 20, 2026 arXiv
  • TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert OffloadMay 19, 2026 arXiv
  • Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMsMay 7, 2026 arXiv
  • R2-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy ReductionApril 21, 2026 arXiv
  • Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic DecodingJanuary 25, 2026 arXiv
  • CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language ModelsJanuary 5, 2026 arXiv
  • WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast InferenceDecember 28, 2025 arXiv
  • Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM InferenceOctober 10, 2025 arXiv
  • dInfer: An Efficient Inference Framework for Diffusion Language ModelsOctober 9, 2025 arXiv
  • Accelerating Diffusion LLM Inference via Local Determinism PropagationOctober 8, 2025 arXiv
  • Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language ModelsSeptember 30, 2025 arXiv
  • Fast-dLLM v2: Efficient Block-Diffusion LLMSeptember 30, 2025 arXiv
  • Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel DecodingSeptember 29, 2025 (ICLR 2026) arXiv
  • Ultra-Fast Language Generation via Discrete Diffusion Divergence InstructSeptember 29, 2025 arXiv
  • d²Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive CachingSeptember 27, 2025 arXiv
  • Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache EvictionAugust 4, 2025 arXiv
  • Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden PrinciplesJune 12, 2025 arXiv
  • Fast-dLLM: Training-Free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel DecodingMay 28, 2025 arXiv
  • Accelerating Diffusion LLMs via Adaptive Parallel DecodingMay 31, 2025 arXiv
  • dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive CachingMay 17, 2025 arXiv

Quantization

  • On the Quantization Robustness of Diffusion Language Models in Coding BenchmarksApril 22, 2026 arXiv
  • Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language ModelsSeptember 27, 2025 arXiv
  • Quantization Meets dLLMs: A Systematic Study of Post-Training Quantization for Diffusion LLMsAugust 20, 2025 arXiv
  • Dllmquant: Quantizing Diffusion-Based Large Language ModelsAugust 14, 2025 arXiv

Retrieval

  • Self-Augmenting Retrieval for Diffusion Language ModelsJune 4, 2026 arXiv
  • DiffRetriever: Parallel Representative Tokens for Retrieval with Diffusion Language ModelsMay 8, 2026 arXiv

Security & Privacy

  • SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel FieldsAugust 21, 2026 arXiv
  • Global Sketch-Based Watermarking for Diffusion Language ModelsJune 3, 2026 arXiv
  • Extracting Training Data from Diffusion Language Models via InfillingMay 22, 2026 arXiv
  • Machine Unlearning for Masked Diffusion Language ModelsMay 18, 2026 arXiv
  • Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model WatermarksMay 6, 2026 arXiv
  • TrustLDM: Benchmarking Trustworthiness in Language Diffusion ModelsApril 15, 2026 arXiv
  • GCG Attack On A Diffusion LLMDecember 30, 2025 arXiv
  • DiffuGuard: How Intrinsic Safety Is Lost and Found in Diffusion Large Language ModelsSeptember 29, 2025 arXiv
  • Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct PositionAugust 17, 2025 arXiv
  • Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text GenerationJuly 25, 2025 arXiv
  • The Devil Behind the Mask: An Emergent Safety Vulnerability of Diffusion LLMsJuly 15, 2025 arXiv

Theory

  • Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control SpaceMay 14, 2026 arXiv
  • Optimal inference schedules for masked diffusion modelsNovember 9, 2025 arXiv
  • On Powerful Ways to Generate: Autoregression, Diffusion, and BeyondOctober 7, 2025 arXiv
  • Why mask diffusion does not workSeptember 25, 2025 arXiv

Applications

  • DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion GuidanceJune 4, 2026 arXiv
  • DiffuSent: Towards a Unified Diffusion Framework for Aspect-Based Sentiment AnalysisMay 31, 2026 arXiv
  • DiffScore: Text Evaluation Beyond Autoregressive LikelihoodMay 12, 2026 arXiv
  • BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and CaptioningApril 27, 2026 arXiv
  • Harnessing LLM for Noise-Robust Cognitive Diagnosis in Web-Based Intelligent Education SystemsOctober 5, 2025 arXiv
  • Discovering Mathematical Equations with Diffusion Language ModelSeptember 16, 2025 arXiv

Analysis/Position Papers

  • What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text GenerationMay 29, 2026 arXiv
  • The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion ModelsMay 27, 2026 arXiv
  • Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDAMay 18, 2026 arXiv
  • Uncertainty Quantification for Large Language Diffusion ModelsMay 14, 2026 arXiv
  • Understanding and Accelerating the Training of Masked Diffusion Language ModelsMay 13, 2026 arXiv
  • Differences in Text Generated by Diffusion and Autoregressive Language ModelsApril 4, 2026 arXiv
  • Efficient Self-Evaluation for Diffusion Language Models via Sequence RegenerationMarch 3, 2026 (ACL 2026) arXiv
  • On the Role of Discreteness in Diffusion LLMsDecember 27, 2025 arXiv
  • Understanding the Limitations of Diffusion LLMs through a Probabilistic Perspective - November 25, 2025 Notion

Surveys

  • Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference TechniquesJuly 14, 2026 arXiv
  • dLLM - Rethinking Generation Beyond Autoregressive ModelsApril 27, 2026 ICLR Blog
  • Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code GenerationSeptember 14, 2025 arXiv
  • Diffusion-Based Large Language Models SurveyAugust 26, 2025 TechRxiv
  • A Survey on Diffusion Language ModelsAugust 14, 2025 arXiv
  • Discrete Diffusion in Large Language and Multimodal Models: A SurveyJune 16, 2025 arXiv
decoding
diffusion-models
discrete-diffusion-models
dllm
inference
llm
masked-diffusion-llm
nlp
rl

Contributors

piesauce

119 commits

lxren

42 commits

celve

2 commits

piesauce/awesome-dLLM-resources

Frequently updated list of dLLM (Diffusion Large Language Models) papers, models, and other resources

Python

55

278 commits

updated Sep 1, 2026

See the code

README

awesome-dLLM-resources

Frequently updated list of dLLM (Diffusion Large Language Models) papers, models, and other resources.

Maintained By Suhas Pai and Xiaojun Ren. For an overview of this field, see our ICLR 2026 blog post.

Make a PR if you want to include your paper on this list or if you've found a cool paper that you think should be included in this list :)

Papers by Category Radar

Libraries

  • dlmserve: First OSS Serving Engine for Diffusion Language Models - May 25, 2026 GitHub
  • DiRL: An Efficient Training Framework for Diffusion Language Models - November 18, 2025 GitHub
  • dLLM: Simple Diffusion Language Modeling - October 11, 2025 GitHub

Models

  • DiffusionGemmaJuly 31, 2026 arXiv
  • Continuous Latent Diffusion Language ModelMay 7, 2026 arXiv
  • W1-4B-dLLM: Whaletech Diffusion LLMApril 13, 2026 Hugging Face Demo
  • LLaDA2.0: Scaling Up Diffusion Language Models to 100BDecember 10, 2025 arXiv
  • Causal Diffusion Language Models - December 4, 2025 Blog Post
  • Soft-Masked Diffusion Language ModelsOctober 20, 2025 arXiv
  • UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language ModelsOctober 12, 2025 arXiv
  • RND1: Simple, Scalable AR-to-Diffusion ConversionOctober 9, 2025 Blog Post
  • SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation - October 7, 2025 arXiv
  • Syntax-Guided Diffusion Language Models with User-Integrated PersonalizationOctober 2, 2025 arXiv
  • CoDA: Coding LM via Diffusion AdaptationSeptember 27, 2025 arXiv
  • LLaDA-MoE: A Sparse MoE Diffusion Language ModelSeptember 25, 2025 arXiv
  • Dream 7B: Diffusion Large Language Models - August 21, 2025 arXiv
  • DiffuCoder: Understanding and Improving Masked Diffusion Models for Code GenerationJune 25, 2025 arXiv
  • Mercury: Ultra-Fast Language Models Based on DiffusionJune 17, 2025 arXiv
  • LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion ModelsMay 25, 2025 arXiv
  • Large Language Diffusion ModelsFebruary 14, 2025 arXiv

Scaling Laws

  • Continuous Diffusion Scales Competitively with Discrete Diffusion for LanguageMay 18, 2026 arXiv
  • Diffusion Language Models Are Super Data LearnersOctober 1, 2025 GitHub
  • Diffusion Beats Autoregressive in Data-Constrained SettingsJuly 21, 2025 arXiv

Architecture & Learning Objectives

  • DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs - May 31, 2026 arXiv
  • WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering - May 30, 2026 arXiv
  • Triplet-Block Diffusion RWKV - May 25, 2026 arXiv
  • DLLM-JEPA: Joint Embedding Predictive Architectures for Masked Diffusion Language Models - May 24, 2026 arXiv
  • DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling - May 22, 2026 arXiv
  • Drifting Objectives for Refining Discrete Diffusion Language Models - May 19, 2026 arXiv
  • Dynamic Chunking for Diffusion Language Models - May 15, 2026 arXiv
  • Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement - May 14, 2026 arXiv
  • BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion - May 12, 2026 arXiv
  • ELF: Embedded Language Flows - May 11, 2026 arXiv
  • How to Train Your Latent Diffusion Language Model Jointly With the Latent Space - May 8, 2026 arXiv
  • TextLDM: Language Modeling with Continuous Latent Diffusion - May 8, 2026 arXiv
  • Token Time Continuous Diffusion for Language Modeling - May 7, 2026 arXiv
  • Towards Closing the Autoregressive Gap in Language Modeling via Entropy-Gated Continuous Bitstream Diffusion - May 7, 2026 arXiv
  • From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons - April 11, 2026 arXiv
  • Beyond Hard Masks: Progressive Token Evolution for Diffusion Language ModelsJanuary 16, 2026 arXiv, Code
  • CANDI: Hybrid Discrete-Continuous Diffusion Models - October 26, 2025 arXiv
  • Any-Order GPT as Masked Diffusion Model: Decoupling Formulation and ArchitectureJune 24, 2025 arXiv

Finetuning/RL

  • Mask-Aware Policy Gradients for Diffusion Language ModelsJuly 16, 2026 arXiv
  • Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language ModelsJune 3, 2026 arXiv
  • Knowledge Editing in Masked Diffusion Language ModelsJune 2, 2026 arXiv
  • Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language ModelsMay 31, 2026 arXiv
  • Learnability-Informed Fine-Tuning of Diffusion Language ModelsMay 21, 2026 arXiv
  • Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language ModelsMay 13, 2026 arXiv
  • Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language ModelsMay 12, 2026 arXiv
  • Relative Score Policy Optimization for Diffusion Language ModelsMay 11, 2026 arXiv
  • DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language ModelsMay 8, 2026 arXiv
  • Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language ModelsMay 8, 2026 arXiv
  • FlowLM: Few-Step Language Modeling via Diffusion-to-Flow AdaptationApril 6, 2026 arXiv
  • Principled RL for Diffusion LLMs Emerges from a Sequence-Level PerspectiveDecember 3, 2025 arXiv
  • Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the WayOctober 28, 2025 arXiv
  • Principled and Tractable RL for Reasoning with Diffusion Language ModelsOctober 5, 2025 arXiv
  • Fine-Tuning Masked Diffusion for Provable Self-CorrectionOctober 1, 2025 arXiv
  • WeFT: Weighted Entropy-Driven Fine-Tuning for dLLMsSeptember 25, 2025 arXiv
  • Inpainting-Guided Policy Optimization for Diffusion Large Language ModelsSeptember 12, 2025 arXiv
  • Revolutionizing Reinforcement Learning Framework for Diffusion Large Language ModelsSeptember 8, 2025 arXiv

Distillation

  • SelFusion: Self-distillation for Diffusion Language ModelsAugust 24, 2026 arXiv
  • Learning from the Self-future: On-policy Self-distillation for dLLMsJune 16, 2026 arXiv, Code
  • Infinite Mask Diffusion for Few-Step DistillationMay 11, 2026 arXiv
  • TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLMMay 10, 2026 arXiv

Reasoning

  • TiDAR: Think in Diffusion, Talk in AutoregressionNovember 12, 2025 arXiv
  • Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy OptimizationOctober 9, 2025 arXiv
  • Improving Reasoning for Diffusion Language Models via Group Diffusion Policy OptimizationOctober 9, 2025 arXiv
  • DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement LearningOctober 2, 2025 arXiv
  • RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free GuidanceSeptember 29, 2025 arXiv
  • Thinking Inside the Mask: In-Place Prompting in Diffusion LLMsAugust 14, 2025 arXiv
  • d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement LearningJune 3, 2025 arXiv

Decoding Strategies

  • Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model InferenceAugust 27, 2026 arXiv
  • Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMsAugust 27, 2026 arXiv
  • Survival-Guided Length Control for Efficient Diffusion Language ModelsAugust 26, 2026 arXiv
  • Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMsAugust 23, 2026 arXiv
  • Length-Adaptive Decoding for Masked Diffusion Machine TranslationAugust 23, 2026 arXiv
  • NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language ModelsJune 4, 2026 arXiv
  • SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMsJune 3, 2026 arXiv
  • Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language ModelsJune 3, 2026 arXiv
  • Supportive Token Revealing for Fast Diffusion Language Model DecodingJune 2, 2026 arXiv
  • DLM-SWAI: Steering Diffusion Language Models Before They UnmaskMay 28, 2026 arXiv
  • When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language ModelsMay 27, 2026 arXiv
  • The Path Matters: Learning a Token-Commitment Policy for Diffusion Language ModelsMay 23, 2026 arXiv
  • Constrained Code Generation with Discrete DiffusionMay 16, 2026 arXiv
  • Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency TeachersMay 16, 2026 arXiv
  • Adaptive Steering and Remasking for Safe Generation in Diffusion Language ModelsMay 13, 2026 arXiv
  • Edit-Based Refinement for Parallel Masked Diffusion Language ModelsMay 10, 2026 arXiv
  • Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language ModelsMay 8, 2026 arXiv
  • When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language ModelsApril 27, 2026 arXiv
  • Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language ModelsApril 20, 2026 arXiv
  • Stability-Weighted Decoding for Diffusion Language ModelsApril 18, 2026 arXiv
  • Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language ModelsApril 6, 2026 arXiv
  • LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language ModelsMarch 24, 2026 arXiv
  • GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language ModelsMarch 4, 2026 arXiv
  • Efficient Self-Evaluation for Diffusion Language Models via Sequence RegenerationMarch 3, 2026 arXiv
  • One Token Is Enough: Improving Diffusion Language Models with a Sink TokenJanuary 27, 2026 arXiv
  • Deferred Commitment Decoding for Diffusion Language Models with Confidence-Aware Sliding WindowsJanuary 5, 2026 arXiv
  • Activation Steering for Masked Diffusion Language ModelsDecember 30, 2025 arXiv
  • ReFusion: A Diffusion Large Language Model with Parallel Autoregressive DecodingDecember 15, 2025 arXiv
  • Beyond Static Cutoffs: One-Shot Dynamic Thresholding for Diffusion Language ModelsNovember 3, 2025 arXiv
  • CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace CreditsOctober 7, 2025 arXiv
  • AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block SizeSeptember 30, 2025 arXiv
  • Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language ModelsSeptember 28, 2025 arXiv
  • Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language ModelsAugust 12, 2025 arXiv
  • Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language ModelsAugust 1, 2025 arXiv
  • Unveiling the Potential of Diffusion Large Language Model in Controllable GenerationJuly 6, 2025 arXiv
  • Remasking Discrete Diffusion Models with Inference-Time ScalingMarch 1, 2025 arXiv

Speculative Decoding

  • SimSD: Simple Speculative Decoding in Diffusion Language ModelsJune 1, 2026 arXiv
  • DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative DecodingJune 1, 2026 arXiv
  • Cost-Aware Diffusion Draft Trees for Speculative DecodingJune 1, 2026 arXiv
  • PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative DecodingMay 15, 2026 arXiv
  • Factorization-Error-Free Discrete Diffusion Language Model via Speculative DecodingMay 14, 2026 arXiv
  • Self-Speculative Decoding for Diffusion Large Language ModelsOctober 5, 2025 arXiv
  • Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative DecodingSeptember 22, 2025 arXiv

Inference Optimization

  • Accelerating Diffusion Language Models via Structured Suffix ModelingAugust 24, 2026 arXiv
  • SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative DecodingJune 3, 2026 arXiv
  • Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM InferenceJune 1, 2026 arXiv, Code, Project Page
  • EPIC: Efficient and Parallel Inference under CFG Constraints for Diffusion Language ModelsMay 30, 2026 arXiv
  • Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence ExtrapolationMay 29, 2026 arXiv
  • PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language ModelsMay 20, 2026 arXiv
  • TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert OffloadMay 19, 2026 arXiv
  • Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMsMay 7, 2026 arXiv
  • R2-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy ReductionApril 21, 2026 arXiv
  • Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic DecodingJanuary 25, 2026 arXiv
  • CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language ModelsJanuary 5, 2026 arXiv
  • WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast InferenceDecember 28, 2025 arXiv
  • Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM InferenceOctober 10, 2025 arXiv
  • dInfer: An Efficient Inference Framework for Diffusion Language ModelsOctober 9, 2025 arXiv
  • Accelerating Diffusion LLM Inference via Local Determinism PropagationOctober 8, 2025 arXiv
  • Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language ModelsSeptember 30, 2025 arXiv
  • Fast-dLLM v2: Efficient Block-Diffusion LLMSeptember 30, 2025 arXiv
  • Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel DecodingSeptember 29, 2025 (ICLR 2026) arXiv
  • Ultra-Fast Language Generation via Discrete Diffusion Divergence InstructSeptember 29, 2025 arXiv
  • d²Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive CachingSeptember 27, 2025 arXiv
  • Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache EvictionAugust 4, 2025 arXiv
  • Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden PrinciplesJune 12, 2025 arXiv
  • Fast-dLLM: Training-Free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel DecodingMay 28, 2025 arXiv
  • Accelerating Diffusion LLMs via Adaptive Parallel DecodingMay 31, 2025 arXiv
  • dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive CachingMay 17, 2025 arXiv

Quantization

  • On the Quantization Robustness of Diffusion Language Models in Coding BenchmarksApril 22, 2026 arXiv
  • Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language ModelsSeptember 27, 2025 arXiv
  • Quantization Meets dLLMs: A Systematic Study of Post-Training Quantization for Diffusion LLMsAugust 20, 2025 arXiv
  • Dllmquant: Quantizing Diffusion-Based Large Language ModelsAugust 14, 2025 arXiv

Retrieval

  • Self-Augmenting Retrieval for Diffusion Language ModelsJune 4, 2026 arXiv
  • DiffRetriever: Parallel Representative Tokens for Retrieval with Diffusion Language ModelsMay 8, 2026 arXiv

Security & Privacy

  • SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel FieldsAugust 21, 2026 arXiv
  • Global Sketch-Based Watermarking for Diffusion Language ModelsJune 3, 2026 arXiv
  • Extracting Training Data from Diffusion Language Models via InfillingMay 22, 2026 arXiv
  • Machine Unlearning for Masked Diffusion Language ModelsMay 18, 2026 arXiv
  • Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model WatermarksMay 6, 2026 arXiv
  • TrustLDM: Benchmarking Trustworthiness in Language Diffusion ModelsApril 15, 2026 arXiv
  • GCG Attack On A Diffusion LLMDecember 30, 2025 arXiv
  • DiffuGuard: How Intrinsic Safety Is Lost and Found in Diffusion Large Language ModelsSeptember 29, 2025 arXiv
  • Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct PositionAugust 17, 2025 arXiv
  • Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text GenerationJuly 25, 2025 arXiv
  • The Devil Behind the Mask: An Emergent Safety Vulnerability of Diffusion LLMsJuly 15, 2025 arXiv

Theory

  • Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control SpaceMay 14, 2026 arXiv
  • Optimal inference schedules for masked diffusion modelsNovember 9, 2025 arXiv
  • On Powerful Ways to Generate: Autoregression, Diffusion, and BeyondOctober 7, 2025 arXiv
  • Why mask diffusion does not workSeptember 25, 2025 arXiv

Applications

  • DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion GuidanceJune 4, 2026 arXiv
  • DiffuSent: Towards a Unified Diffusion Framework for Aspect-Based Sentiment AnalysisMay 31, 2026 arXiv
  • DiffScore: Text Evaluation Beyond Autoregressive LikelihoodMay 12, 2026 arXiv
  • BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and CaptioningApril 27, 2026 arXiv
  • Harnessing LLM for Noise-Robust Cognitive Diagnosis in Web-Based Intelligent Education SystemsOctober 5, 2025 arXiv
  • Discovering Mathematical Equations with Diffusion Language ModelSeptember 16, 2025 arXiv

Analysis/Position Papers

  • What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text GenerationMay 29, 2026 arXiv
  • The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion ModelsMay 27, 2026 arXiv
  • Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDAMay 18, 2026 arXiv
  • Uncertainty Quantification for Large Language Diffusion ModelsMay 14, 2026 arXiv
  • Understanding and Accelerating the Training of Masked Diffusion Language ModelsMay 13, 2026 arXiv
  • Differences in Text Generated by Diffusion and Autoregressive Language ModelsApril 4, 2026 arXiv
  • Efficient Self-Evaluation for Diffusion Language Models via Sequence RegenerationMarch 3, 2026 (ACL 2026) arXiv
  • On the Role of Discreteness in Diffusion LLMsDecember 27, 2025 arXiv
  • Understanding the Limitations of Diffusion LLMs through a Probabilistic Perspective - November 25, 2025 Notion

Surveys

  • Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference TechniquesJuly 14, 2026 arXiv
  • dLLM - Rethinking Generation Beyond Autoregressive ModelsApril 27, 2026 ICLR Blog
  • Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code GenerationSeptember 14, 2025 arXiv
  • Diffusion-Based Large Language Models SurveyAugust 26, 2025 TechRxiv
  • A Survey on Diffusion Language ModelsAugust 14, 2025 arXiv
  • Discrete Diffusion in Large Language and Multimodal Models: A SurveyJune 16, 2025 arXiv
decoding
diffusion-models
discrete-diffusion-models
dllm
inference
llm
masked-diffusion-llm
nlp
rl

Contributors

piesauce

119 commits

lxren

42 commits

celve

2 commits

Languages

Python

100.0%