AIDASLab/Awesome-Diffusion-LLM

A comprehensive list of papers about Large-Language-Diffusion-Models.

103

119 commits

updated Sep 1, 2026

See the code

README

Awesome-Large-Language-Diffusion-Models

Awesome Maintained

A comprehensive and structured list of research papers about Large-Language-Diffusion-Models (dLLMs).

Last major update: September 2026 — added 169 new papers from Jun–Aug 2026.


⚙️ Framework (Taxonomy)

  1. Surveys & Useful Resources
  2. Core Methodologies
  3. Reasoning & Policy Optimization
  4. Token Ordering & Generation Strategies
  5. System Efficiency & Acceleration
  6. Multi-modal & Physical AI
  7. Agentic & Tool-Use dLLMs
  8. Theory, Guidance & Applications
  9. Seminal Diffusion Papers

1. Surveys & Useful Resources

📚 Blogs & Reports

📝 Survey & Perspective Papers


2. Core Methodologies

2.1 Discrete & Masked Diffusion

Paper TitleYearVenueRemark
DiffusER: Discrete Diffusion via Edit-based Reconstruction2022.10ICLR<7B
SSD-LM: Semi-autoregressive Simplex-based Diffusion for Modular Control2022.10ACL<7B, Simplex
DiffusionBERT: Improving Generative Masked Language Models2022.11ACL<7B, Masked
A Reparameterized Discrete Diffusion Model for Text Generation2023.02COLM<7B
David helps Goliath: Inference-Time Collaboration Between Small and Large Diffusion LMs2023.05NAACL>7B, Scale-collaboration
TESS: Text-to-Text Self-Conditioned Simplex Diffusion2023.05EACL<7B, Simplex
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning2023.08Arxiv>7B, Scaling
Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution (SEDD)2023.10ICML<7B, Discrete
Simplified and Generalized Masked Diffusion for Discrete Data (MD4)2024.06NeurIPS-
Simple and Effective Masked Diffusion Language Models (MDLM)2024.06NeurIPS<7B, Masked
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data (RADD)2024.06ICLR<7B, Masked
Scaling up Masked Diffusion Models on Text (SMDM)2024.10ICLR<7B, 1.1B Scaling
Energy-Based Diffusion Language Models for Text Generation (EDLM)2024.10ICLR<7B
Conditional MASK Discrete Diffusion Language Model2024.11EMNLP<7B
Non-Markovian Discrete Diffusion with Causal Language Models2025.02NeurIPS<7B
Large Language Diffusion Models (LLaDA)2025.02NeurIPS>7B, LLaDA-8B
Anchored Diffusion Language Model (ADLM)2025.05NeurIPS>7B; ANELBO objective
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs2025.06AAAI>7B, Context Scaling
Esoteric Language Models (Eso-LMs)2025.06ICMLAR + MDM hybrid
Dream 7B: Diffusion Large Language Models2025.08Arxiv>7B, Dream-7B
Sequential Diffusion Language Models2025.09Arxiv>7B
LLaDA-MoE: A Sparse MoE Diffusion Language Model2025.09Arxiv>7B, 7B-A1B MoE from scratch
UltraLLaDA: Scaling Context to 128K2025.10Arxiv>7B, Context Scaling
Next Semantic Scale Prediction via Hierarchical Diffusion Language Models2025.10NeurIPS-
Masked Diffusion Models as Energy Minimization2025.10NeurIPS<7B
Soft-Masked Diffusion Language Models2025.10ICLR<7B
Variational Masked Diffusion Models2025.10Arxiv<7B
Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the Way2025.10Arxiv>7B, Variable Length
Diffusion Language Models are Super Data Learners2025.11ArxivData efficiency
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone2025.11ArxivNon-Transformer Backbone
TiDAR: Think in Diffusion, Talk in Autoregression2025.11Arxiv>7B
C2DLM: Causal Concept-Guided Diffusion Large Language Models2025.11Arxiv>7B
Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models2026.01ACLSoft tokens, Masked
LLaDA2.0: Scaling Up Diffusion Language Models to 100B2025.12Arxiv>100B, MoE; Ant Group
LLaDA2.1: Speeding Up Text Diffusion via Token Editing2026.02ArxivEditable State Evolution
Introspective Diffusion Language Models (I-DLM)2026.04ArxivIntrospective consistency
W1-4B-dLLM (WhaletechAI)2026.04HF Model4B open dLLM; demo
Scaling Beyond Masked Diffusion Language Models2026.02ArxivUniform-state & interpolating diffusion scaling
dLLM: Simple Diffusion Language Modeling2026.02ArxivUnified open-source dLLM framework
Generalized Discrete Diffusion from Snapshots2026.03ArxivUnified arbitrary noising framework
Diffutron: A Masked Diffusion Language Model for Turkish Language2026.03ArxivMultilingual, Turkish MDM
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models2026.04COLMMoE, Expert-choice routing
Rethinking Token Prediction: Tree-Structured Diffusion Language Model2026.04ArxivTree-structured token prediction
Drifting Objectives for Refining Discrete Diffusion Language Models2026.05ArxivTokenDrift, anti-symmetric objective
Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement2026.06Arxiv-
Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design2026.06ArxivImproving Diffusion Language Models through Bias-variance
VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination2026.06ArxivCode
Sumi: Open Uniform Diffusion Language Model from Scratch2026.06ArxivOpen Uniform Diffusion Language Model from
Improved Large Language Diffusion Models2026.06Arxiv-
Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation2026.06ArxivKV cache, Serving
Tensor-Train Joint Modeling for Few-Step Discrete Diffusion2026.07ArxivFew-step, Unmasking order
PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention2026.07ArxivPretrained Discrete Masked Diffusion Language Modeling
DiffusionGemma Technical Report2026.07ArxivMoE, Speculative decoding
Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy2026.07ArxivPosterior-Mean Denoisers for Score Entropy
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models2026.08ArxivMoE
MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models2026.08ArxivDistribution Aware Positional Encoding for Masked
Retrofitting Linear Attention into Diffusion Language Models2026.08ArxivBlock diffusion, Serving
Reducing Pretraining-Generation Mismatch in Diffusion Language Models2026.08Arxiv-

2.2 Continuous & Latent Space Diffusion

Paper TitleYearVenueRemark
Diffusion-LM Improves Controllable Text Generation2022.05NeurIPS<7B, Embedding
DiffuSeq: Sequence to Sequence Text Generation2022.10ICLR<7B, Embedding
Latent Diffusion for Language Generation2022.12NeurIPS<7B, Latent
Diffusion Glancing Transformer for Parallel Sequence to Sequence Learning2022.12NAACL<7B
Empowering Diffusion Models on the Embedding Space for Text Generation2022.12NAACL<7B, Embedding
Text Generation with Diffusion Language Models: A Pre-training Approach with Continuous Paragraph Denoise2022.12ICML<7B, Embedding
DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises2023.02TACL<7B, Embedding
Likelihood-Based Diffusion Language Models (Plaid)2023.05NeurIPS<7B, Plaid 1B
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model2023.06NeurIPS<7B, Latent
Edit Flows: Flow Matching with Edit Operations2025.06Arxiv-
Coevolutionary Continuous Discrete Diffusion: Latent Reasoner2025.10ICML>7B; CCDD
Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning2026.02ArxivLatent planning + AR hybrid
CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think2026.03ArxivContextual AR decoder for continuous diffusion
LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling2026.04ArxivFlow matching via Bregman divergence
Scaling Properties of Continuous Diffusion Spoken Language Models2026.04ArxivContinuous diffusion SLM, scaling laws
Towards Closing the Autoregressive Gap via Entropy-Gated Continuous Bitstream Diffusion2026.05ArxivContinuous bitstream diffusion
TextLDM: Language Modeling with Continuous Latent Diffusion2026.05ArxivDiT-style flow matching for text
How to Train Your Latent Diffusion Language Model Jointly With the Latent Space2026.05ArxivJoint latent encoder+diffusion training
BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion2026.05ArxivBitwise continuous diffusion head
Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space2026.05ArxivHJB-based latent optimal control
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language2026.05ArxivRePlaid scaling law, continuous vs discrete
Simplex Relaxation for Discrete Diffusion2026.08Arxiv-

2.3 AR-to-Diffusion Adaptation

2.4 Hybrid AR-Diffusion (Block / Forcing)

A new section: hybrids that interleave block-level AR with intra-block diffusion, or "forcing" approaches that retain causal masks for KV-cache reuse.

Paper TitleYearVenueRemark
Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models (BD3-LM)2025.03ICLR<7B, Interpolation
D2F: Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing2025.08ICLR>7B, Faster-than-AR
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding2025.08Arxiv>7B
SDAR: Synergistic Diffusion-AutoRegression Paradigm2025.10Arxiv>7B, Block hybrid
Encoder-Decoder Block Diffusion Language Models for Efficient Training and Inference (E2D2)2025.10NeurIPSBlock Enc-Dec
Fast-dLLM v2: Efficient Block-Diffusion LLM2025.09Arxiv>7B, Block Decoding
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference2025.12ArxivCausal-attn diffusion
ReFusion: Diffusion LLM with Parallel Autoregressive Decoding2025.12ArxivSlot-level interleaving
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models2026.02ArxivAdaptive block
DFlash: Block Diffusion for Flash Speculative Decoding2026.02ICMLBlock + speculative
Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models2026.04ACLAnchor-based cross-block decoding
When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language Models2026.04ArxivVariable-size blocks
Dynamic Chunking for Diffusion Language Models2026.05ArxivContent-defined semantic chunks
FLARE: Diffusion for Hybrid Language Model2026.06ArxivServing
BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers2026.06ArxivFew-step, Block diffusion
SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs2026.06ArxivBlock diffusion
Multi-Block Diffusion Language Models2026.06ArxivBlock diffusion
Adaptive Block Diffusion: Resolving Training-Inference Mismatch in Diffusion Language Models2026.06ArxivBlock diffusion
Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models2026.06ArxivTraining-free, KV cache
Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding2026.07ICMLKV cache, Block diffusion
Training Hybrid Block Diffusion Language Models with Partial Bidirectionality2026.07ArxivBlock diffusion, Serving
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding2026.07ArxivServing

3. Reasoning & Policy Optimization

3.1 Reasoning & Planning

Paper TitleYearVenueRemark
Diffusion of Thought: Chain-of-Thought Reasoning in dLLMs2024.02NeurIPS<7B, CoT Foundation
Beyond Autoregression: Discrete Diffusion for Complex Reasoning2024.10ICLR<7B
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models2025.09ArxivPlanning
d1: Scaling Reasoning in dLLMs via RL2025.04NeurIPS>7B, Reasoning scaling
Reinforcing the Diffusion Chain of Lateral Thought2025.05NeurIPS>7B
Thinking Inside the Mask: In-Place Prompting in dLLMs2025.08Arxiv>7B
Reinforced Context Order Recovery for Adaptive Reasoning2025.08Arxiv<7B, Planning
d2: Improved Techniques for Training Reasoning dLLMs2025.09Arxiv>7B
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning2025.10Arxiv>7B
Beyond Surface Reasoning: Unveiling Long CoT Capacity2025.10Arxiv>7B
Coevolutionary Continuous Discrete Diffusion: Latent Reasoner2025.10ICML>7B
On the Reasoning Abilities of Masked Diffusion Language Models2025.10Arxiv>7B
Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning2025.10ArxivCollaboration
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning2025.10Arxiv>7B
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching2026.02ArxivStep-level rationale stitching
Reasoning or Rationalization? The Role of Justifications in Masked Diffusion Models for Fact Verification2026.03ArxivCoT dynamics analysis
Diffusion LLMs can think EoS-by-EoS2026.03ArxivEoS-guided reasoning via padding
LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language Models2026.03ArxivLogic-guided unmasking order
Learnability-Informed Fine-Tuning of Diffusion Language Models2026.05ArxivLIFT, SFT with learnability schedule
d-OPSD: On-Policy Self-Distillation for Diffusion Language Models2026.06ArxivOn-policy self-distillation, Code
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models2026.06Arxiv-
DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models2026.06Arxiv8B, Block diffusion
Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation2026.06ArxivBlock diffusion
Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models2026.06ArxivUnmasking order
Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs2026.08ArxivTraining-free, Unmasking order
Semantic Reasoning Denoising: Correcting Language Model Reasoning with Semantic Operators2026.08ArxivCorrecting Language Model Reasoning with Semantic
DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models2026.08ArxivDraft-Conditioned Global Correction for Complex Reasoning

3.2 Alignment & Reinforcement Learning

Paper TitleYearVenueRemark
Preference-Based Alignment of Discrete Diffusion Models2025.03Arxiv>7B
DiFFPO: Training dLLMs to Reason Fast and Furious via RL2025.10Arxiv>7B, Direct Preference
LLaDA 1.5: Variance-Reduced Preference Optimization2025.05Arxiv>7B
wd1: Weighted Policy Optimization for Reasoning2025.07ICLR>7B
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position2025.08AAAI>7B, Safety
Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation2025.07ArxivSafety
The Devil behind the mask: An emergent safety vulnerability2025.07ICLRSafety
MDPO: Overcoming the Training-Inference Divide2025.08Arxiv>7B
Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs2025.08EMNLP>7B
Inpainting-Guided Policy Optimization for dLLMs2025.09Arxiv>7B
Taming Masked Diffusion via Consistency Trajectory RL2025.09Arxiv>7B
TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning2025.09Arxiv>7B
Revolutionizing RL Framework for Diffusion Large Language Models2025.09Arxiv>7B
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models2025.09ICLRSafety
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models2025.09ArxivSafety
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance2025.09Arxiv>7B
AGRPO: Simple Policy Gradients for Reasoning with Diffusion Language Models2025.10Arxiv>7B
Improving Reasoning via Group Diffusion Policy Optimization (GDPO)2025.10Arxiv>7B
Step-Aware Policy Optimization for Reasoning2025.10Arxiv>7B
MRO: Enhancing Reasoning via Multi-Reward Optimization2025.10NeurIPS>7B
Enhancing Reasoning via Distribution Matching Policy Optimization2025.10Arxiv>7B
Boundary-Guided Policy Optimization for Memory-efficient RL2025.10Arxiv>7B
SPG: Sandwiched Policy Gradient for Masked Diffusion2025.10Arxiv>7B
Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies2025.10ICLR>7B
Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States2025.10Arxiv>7B
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective2025.12Arxiv>7B
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models2025.12Arxiv>7B
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor2026.04ArxivUnified RL framework
DiRL: An Efficient Post-Training Framework for Diffusion Language Models2025.12ArxivPost-training
Efficient and Stable Reinforcement Learning for Diffusion Language Models2026.02ArxivVariance reduction
Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation2026.01ArxivMulti-agent RL
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages2026.03ArxivMDP formulation, entropy-guided steps
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models2026.04ArxivTrajectory-ranked SFT
Relative Score Policy Optimization for Diffusion Language Models2026.05ArxivRSPO, RLVR for dLLMs
Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models2026.05ArxivSafety, contrastive steering
Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models2026.05ArxivTraFL, trajectory-balance objective
Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models2026.06ArxivMoE, Unmasking order
Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models2026.06ArxivRL
A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding2026.06ArxivUnmasking order
SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing2026.06ArxivTraining-free, RL
A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models2026.07ArxivRL
Mask-Aware Policy Gradients for Diffusion Language Models2026.07COLMRemasking, Unmasking order
Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models2026.08ArxivRL

4. Token Ordering & Generation Strategies

Paper TitleYearVenueRemark
SSD-LM: Semi-autoregressive Simplex-based Diffusion for Modular Control2022.10ACL<7B, Blockwise
AR-Diffusion: Auto-Regressive Diffusion Model for Text Generation2023.05NeurIPS<7B, AR-like noise
Train for the Worst, Plan for the Best: Understanding Token Ordering2025.02ICML<7B, Ordering Analysis
Block Diffusion: Interpolating Between Autoregressive and Diffusion LMs2025.03ICLR<7B, Interpolation
Review, Remask, Refine (R3): Process-Guided Block Diffusion2025.07ICML MOSS>7B, Block-wise
Any-Order Flexible Length Masked Diffusion2025.09Arxiv<7B, Order Flexibility
Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models2025.09Arxiv>7B, Remasking
Don't Let It Fade: Preserving Edits via Token Timestep Allocation2025.10NeurIPS<7B, Edit preservation
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models2025.10Arxiv>7B, Unmasking
Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies2025.10ICLR>7B, Unmasking
Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing2025.10Arxiv>7B, Unmasking
Diffusion Language Model Inference with Monte Carlo Tree Search2025.12Arxiv>7B, MCTS
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty2025.12Arxiv>7B, Unmasking
Adaptation to Intrinsic Dependence in Diffusion Language Models2026.02ArxivDistribution-agnostic schedule
Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration2026.03ACLSelf-evaluation, Flexible length
D5P4: Partition Determinantal Point Process for Diversity in Parallel Discrete Diffusion Decoding2026.03ArxivDiversity-aware decoding
Improving Sampling for Masked Diffusion Models via Information Gain2026.02ArxivInfo-Gain sampler
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models2026.03ArxivDependency-aware unmasking
Diffusion Language Models Are Natively Length-Aware2026.03ArxivLength-aware EoS generation
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models2026.04ArxivQuality vs exploration trade-off
Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language Models2026.04ArxivT2M refinement, LLaDA2.1 analysis
Edit-Based Refinement for Parallel Masked Diffusion Language Models2026.05ICMLME-DLM, edit-based post-correction
When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models2026.05ArxivSuffix anchor, confidence modulation
Supportive Token Revealing for Fast Diffusion Language Model Decoding2026.06ArxivTraining-free
NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models2026.06ArxivRemasking, Unmasking order
Re-evaluating Confidence Remasking in Masked Diffusion Language Models2026.06ArxivTraining-free, Remasking
Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models2026.06ACLUnmasking order, RL
Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models2026.06Arxiv-
Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens2026.06ArxivTraining-free, Remasking
When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models2026.06ArxivNoise Level as a Granularity Axis
TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding2026.07ArxivTraining-free
Don't Commit Alone: Joint Token Commitment in Diffusion Language Models2026.07ArxivJoint Token Commitment in Diffusion Language
Reinforcing the Generation Order of Multimodal Masked Diffusion Models2026.07ArxivRL, dMLLM
ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding2026.07ICMLTraining-free, Unmasking order
Rethinking the Generation Order of Block Diffusion Language Models2026.07ArxivTraining-free, Unmasking order
Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion Language Models2026.07ArxivCoordinating Adaptive Sampling and Early Exit
Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs2026.08EMNLPdMLLM, Context-aware token ordering, Code
Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models2026.08ArxivTraining-free, Unmasking order
Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference2026.08ArxivTraining-free, Remasking
Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models2026.08ArxivUnmasking order, dMLLM
Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs2026.08EMNLP FindingsTraining-free, Hallucination

5. System Efficiency & Acceleration

5.1 Caching & Memory Strategy

Paper TitleYearVenueRemark
dKV-Cache: The Cache for Diffusion Language Models2025.05NeurIPS>7B
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion2025.05Arxiv>7B
Fast-dLLM: Training-free Acceleration via KV Cache + Parallel Decoding2025.05ArxivNVIDIA; KV cache + parallel
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching2025.06ICML>7B
d^2Cache: Accelerating via Dual Adaptive Caching2025.09ICLR>7B
Attention Is All You Need for KV Cache in dLLMs2025.10Arxiv>7B
Attention Sinks in Diffusion Language Models2025.10Arxiv>7B
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference2025.12Arxiv>7B, Causal cache
Stop the Flip-Flop: Context-Preserving Verification for Fast Revocable Diffusion Decoding (COVER)2026.02ArxivKV-override verification
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing2026.02ArxivLong-context sparsity
Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming2026.01ArxivLong-context memory
Residual Context Diffusion Language Models2026.01ArxivRecycle discarded tokens
MAGE: All-[MASK] Block Already Knows Where to Look in Diffusion LLM2026.02ArxivMASK-guided sparse attention, block dLLM
MetaState: Persistent Working Memory for Discrete Diffusion Language Models2026.03ArxivGRU-style cross-step memory
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention2026.03ICMLSaliency-based partial attention
EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models2026.03ArxivEntropy-guided KV cache refresh
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models2026.04ArxivLocality-aware sparse KV, block dLLM
PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models2026.05ArxivColumn-sparse attention, periodic refresh
Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference2026.06ICML Workshop
Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models2026.06EMNLPTraining-free, Long context
HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval2026.06ArxivKV cache, Block diffusion
Affix Cache for Diffusion Large Language Models2026.06ArxivServing
LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models2026.07ArxivTraining-free, Quantization
Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models2026.08ArxivTraining-free

5.2 Decoding & Sampling

Paper TitleYearVenueRemark
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion2024.08NAACL<7B, Speculative Decoding
Wide-In, Narrow-Out: Revokable Decoding for Effective dLLMs2025.07Arxiv>7B
Accelerating Diffusion LLMs via Adaptive Parallel Decoding (APD)2025.05NeurIPS>7B
DLM-One: Diffusion Language Models for One-Step Generation2025.06Arxiv<7B
Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles2025.06Arxiv>7B
Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models2025.06ICML>7B
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models2025.08Arxiv>7B
DPad: Efficient Diffusion Language Models with Suffix Dropout2025.08Arxiv>7B
Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning2025.09NeurIPS>7B
AdaBlock-dLLM: Semantic-Aware Inference via Adaptive Block Size2025.09ICLR>7B
dParallel: Learnable Parallel Decoding for dLLMs2025.09Arxiv>7B
Learning to Parallel: Accelerating dLLMs via Learnable Parallel Decoding2025.09Arxiv>7B
Spiffy: Multiplying Acceleration via Lossless Speculative Decoding2025.09ICML Workshop>7B, Speculative Decoding
DiffuSpec: Unlocking dLLMs for Speculative Decoding2025.09Arxiv>7B, Speculative Decoding
Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall2025.10ICLR>7B
Saber: Efficient Sampling with Backtracking Enhanced Remasking2025.10ACL>7B
CreditDecoding: Parallel Decoding with Trace Credits2025.10ACL>7B
Accelerating dLLM Inference via Local Determinism Propagation2025.10Arxiv>7B
Self Speculative Decoding for Diffusion Large Language Models2025.10Arxiv>7B, Speculative Decoding
SpecDiff-2: Scaling Diffusion Drafter Alignment2025.11Arxiv>7B, Speculative Decoding
Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models2025.11Arxiv>7B
Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models2025.11Arxiv>7B
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs2025.12Arxiv>7B, Speculative Decoding
Fast-Decoding via Progress-Aware Confidence Schedules2025.12Arxiv>7B
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding2025.12Arxiv>7B
Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models2025.12Arxiv>7B
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference2026.01ArxivSpeculative drafting
DFlash: Block Diffusion for Flash Speculative Decoding2026.02ICMLBlock + speculative
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models2026.02ArxivEntropy-adaptive blocks
Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding2026.02ArxivDiCo, three-phase parallel decoding
Free Lunch for Pass@k? Low Cost Diverse Sampling for Diffusion Language Models2026.03ArxivDiverse sampling, Pass@k
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation2026.03ArxivSelf-speculation, block diffusion
Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models2026.04ArxivDEMASK, dependency predictor
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models2026.04ArxivSpeculative + causal drafter
Accelerating Speculative Decoding with Block Diffusion Draft Trees2026.04ArxivDraft trees for block diffusion
Stability-Weighted Decoding for Diffusion Language Models2026.04ArxivKL-based token stability metric
R²-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction2026.04ArxivSpatial + temporal redundancy reduction
Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast2026.05ArxivSelf-contrast, HD token focus
Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding2026.05ArxivFeF-DLLM, prefix-conditioned factorization
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding2026.05ArxivParallel speculative, hierarchical acceptance
Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers2026.05ArxivWINO revokable parallel decoding
Cost-Aware Diffusion Draft Trees for Speculative Decoding2026.06ArxivSpeculative decoding, Block diffusion
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding2026.06ArxivSpeculative decoding, Block diffusion
SimSD: Simple Speculative Decoding in Diffusion Language Models2026.06ArxivTraining-free, KV cache
SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative Decoding2026.06ArxivBlock diffusion
Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge2026.06ICML-
AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding2026.06ArxivTraining-free, Block diffusion
Unified Energy for Invariant and Independent Decoding in Diffusion Language Models2026.06Arxiv-
Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models2026.06ArxivTraining-free
Teaching Diffusion to Speculate Left-to-Right2026.06ArxivSpeculative decoding
Mean-Field Parallel Decoding for Discrete Diffusion Language Models2026.06ArxivTraining-free
LESS Is More: Mutual-Stability Sampling for Diffusion Language Models2026.06ArxivTraining-free, Unmasking order
Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks2026.06ArxivTraining-free
$x$-Prediction Flow: Efficient Continuous Decoding for Masked Diffusion Language Models2026.06ArxivUnmasking order, RL
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding2026.06ArxivSpeculative decoding
PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding2026.06ArxivSpeculative decoding, Serving
GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring2026.06ArxivSpeculative decoding, Serving
Accelerating Discrete Diffusion Models with Parallel-In-Time Sampling2026.07Arxiv-
DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding2026.07ArxivTraining-free, Speculative decoding
Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models2026.07ArxivFew-step
FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models2026.07ArxivTraining-free, KV cache
AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters2026.07ArxivSpeculative decoding, Distillation
AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding2026.07ArxivSpeculative decoding, Serving
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models2026.07ArxivTraining-free, Speculative decoding
CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference2026.07ArxivTraining-free, Block diffusion
DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models2026.08ArxivTraining-free, Compression
xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding2026.08ArxivSpeculative decoding, Serving
DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding2026.08ArxivSpeculative decoding, Block diffusion
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization2026.08ArxivTraining-free, Speculative decoding
CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing2026.08ArxivDistillation
From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding2026.08ArxivSpeculative decoding
LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding2026.08ArxivSpeculative decoding, Serving
CAI-DLLM: Convergence Aware Inference for Diffusion Language Models2026.08ArxivTraining-free, Long context
Accelerating Diffusion Language Models via Structured Suffix Modeling2026.08ArxivTraining-free, KV cache
Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models2026.08ArxivUnmasking order
Survival-Guided Length Control for Efficient Diffusion Language Models2026.08EMNLPTraining-free
Trajectory-Level Speculative Decoding for Diffusion Language Models2026.08ArxivSpeculative decoding, Unmasking order
ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding2026.08ArxivSpeculative decoding, Code
Ceiling-Clipped Acceptance Histograms Indicate Stranded Speed-up in Block-Diffusion Speculative Decoding2026.08ArxivSpeculative decoding
CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models2026.08EMNLP FindingsTraining-free, Block diffusion

5.3 Distillation, Quantization & Sparsity

Paper TitleYearVenueRemark
Beyond Autoregression: Fast LLMs via Self-Distillation Through Time2024.10ICLR<7B, Distillation
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction2025.08Arxiv>7B, Sparsity
DLLMQuant: Quantizing Diffusion-based Large Language Models2025.08Arxiv>7B, Quantization
Quantization Meets dLLMs: Post-training Quantization Study2025.08Arxiv>7B, Quantization
FS-DFM: Few-Step Diffusion Language Model2025.09ICLR>7B
SparseD: Sparse Attention for Diffusion Language Models2025.09Arxiv>7B, Sparsity
LLaDA-MoE: A Sparse MoE Diffusion Language Model2025.09Arxiv>7B, MoE
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct2025.10Arxiv>7B, Distillation
CDLM: Consistency Diffusion Language Models For Faster Sampling2025.11Arxiv>7B, Consistency
Sink-Aware Pruning for Diffusion Language Models2026.02ArxivUnstable sink pruning
FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation2026.04ACL FindingsFew-step distillation, S2S
On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks2026.04ArxivGPTQ/HAWQ on code dLLMs
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models2026.04ArxivCross-architecture dLLM distillation
TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM2026.05ArxivTrajectory self-distillation
Infinite Mask Diffusion for Few-Step Distillation2026.05ArxivIMDM, stochastic infinite-state mask
Self-Distilled Trajectory-Aware Boltzmann Modeling for Diffusion Language Models2026.05ArxivTABOM, Boltzmann ranking objective
DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling2026.05ArxivLatent + consistency distillation
STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models2026.06ArxivQuantization, Unmasking order
FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models2026.06ICMLQuantization
Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation2026.07ArxivTraining-free, Serving
Trace-Based On-Policy Distillation for Masked Diffusion Language Models2026.07ArxivDistillation, RL
Multi-Mask Diffusion Language Models for Few-Step Generation2026.07ArxivDistillation, Few-step
Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising2026.07ArxivBlock diffusion, Serving
REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models2026.08ArxivMoE, Training-free
OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models2026.08ArxivDistillation, Few-step
SelFusion: Self-distillation for Diffusion Language Models2026.08ACLDistillation

5.4 Inference Frameworks & Systems

New section: production-grade frameworks and runtime engineering for dLLMs.

Paper TitleYearVenueRemark
dlmserve2026.05RepoFirst OSS serving engine for diffusion LMs (LLaDA family); OpenAI-compatible HTTP, step-level batching (2.5x HF), LocalLeap (1.8x). MIT.
FOCUS: DLLMs Know How to Tame Their Compute Bound2026.01ICMLTraining-free inference system; token eviction for higher throughput
dInfer: An Efficient Inference Framework for Diffusion Language Models2025.10ArxivModular framework, >1100 TPS
JetEngine (SDAR)2025.10RepoLightweight engine for SDAR (3700+ TPS on H200)
Mercury: Ultra-Fast Language Models Based on Diffusion2025.06ArxivInception Labs commercial dLLM
Seed Diffusion: Large-Scale dLLM with High-Speed Inference2025.08ArxivByteDance code-focused dLLM
TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload2026.05ArxivMoE expert offload, lossless
Efficient On-Device Diffusion LLM Inference with Mobile NPU2026.06ArxivKV cache, Speculative decoding
DiLaServe: High SLO Attainment Serving for Diffusion Language Models2026.06ArxivServing
Sangam: Efficiently Serving Diffusion LLMs with the AR Stack2026.07ArxivServing
BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving2026.07ArxivServing
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware2026.08ArxivServing

6. Multi-modal & Physical AI

6.1 Multi-modal dLLMs

Paper TitleYearVenueRemark
Dual Diffusion for Unified Image Generation and Understanding2025.01ArxivUnified Task
Unified Multimodal Discrete Diffusion (UniDisc)2025.03ArxivUnified Diffusion
LaViDa: A Large Diffusion LLM for Multimodal Understanding2025.05NeurIPS SpotlightUnderstanding
MMaDA: Multimodal Large Diffusion Language Models2025.05NeurIPSNative Multimodal
Dimple: Discrete Diffusion Multimodal LLM with Parallel Decoding2025.05ArxivParallel Multimodal
LLaDA-V: Diffusion LLMs with Visual Instruction Tuning2025.06ArxivVisual Tuning
Muddit: Liberating Generation Beyond Text-to-Image2025.05ICLRMulti-modal
Show-o2: Improved Native Unified Multimodal Models2025.06ArxivUnified Generation
Diffuse Everything: Multimodal Diffusion on Arbitrary Spaces2025.06ICMLArbitrary Spaces
TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning2025.08ArxivTencent ladder-side tuning
Lumina-DiMOO: Omni Diffusion LLM for Generation2025.10ArxivOmni-generation
MMaDA-Parallel: Thinking-Aware Editing and Generation2025.11ArxivParallel Multimodal
DiffusionVL: Translating AR Models into Diffusion VL Models2025.12ArxivVL Adaptation
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding2025.12ArxivBlock-diffusion VL
Dream-VL: Open Vision-Language Model with Diffusion Backbone2025.12ArxivdVLM from Dream-7B
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models2026.02ArxivUnified RL post-training
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion2026.03ICMLAny-to-any (text/speech/image)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation2026.04ArxivSigLIP-VQ + block diffusion
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM2026.04ArxivAR-VLM → block-diffusion VLM
Analyzing Diffusion and Autoregressive VLMs in Multimodal Embedding Space2026.02ArxivEmbedding analysis
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model2026.03ArxivOmnimodal
UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning2026.06ArxivUnified Audio-Text Diffusion for Audio Generation,
Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model2026.06ArxivRL, dMLLM
PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models2026.06ArxivdMLLM
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes2026.07ArxivTraining-free, Remasking
Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?2026.08ArxivTraining-free, Retrieval

6.2 Vision-Language-Action (VLA)

Scope note: this section covers VLA models that use a diffusion/masked-diffusion language model as the backbone (dVLM-based VLA) or apply discrete diffusion as the action-decoding mechanism (not continuous diffusion action heads grafted onto an AR VLM). Pure continuous-diffusion-policy VLAs such as DiVLA (Wen et al., 2024), HybridVLA, and ProgressVLA are intentionally excluded because their language model is autoregressive — only the action head is diffusion-based.

(a) dVLM-backbone VLA — language backbone itself is a diffusion language model.

Paper TitleYearVenueRemark
LLaDA-VLA: Vision Language Diffusion Action Models2025.09ArxivFirst LLaDA(d-VLM)-based VLA
dVLA: Diffusion VLA with Multimodal Chain-of-Thought2025.09ArxivdLLM backbone + multimodal CoT
Dream-VLA: Open Vision-Language-Action Model with Diffusion Backbone2025.12ArxivdVLA from Dream-7B; first dLLM pretrained VLA
MMaDA-VLA: Large Diffusion VLA with Unified Multi-Modal Instruction and Generation2026.03ArxivNative discrete-diffusion VLA from MMaDA

(b) Discrete-diffusion action decoding — language backbone may still be AR-VLM, but action chunks are decoded via discrete diffusion. Closely tied to dLLM literature for inference techniques.

Paper TitleYearVenueRemark
Discrete Diffusion VLA: Action Decoding in VLA Policies2025.08ICMLUnified-transformer + discrete-diffusion actions
E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion2025.11ArxivAR-VLM backbone + Tweedie discrete diffusion on action tokens

6.3 Autonomous Driving / World Models

Scope note: works that apply discrete diffusion / masked-diffusion language modeling to driving trajectories, action codebooks, or tokenized world states. Continuous trajectory-diffusion planners (e.g., classical Diffusion Policy applied to driving) are out of scope.

Paper TitleYearVenueRemark
Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion2023.11ICLRDiscrete diffusion on tokenized point-cloud world model
ReflectDrive: Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving2025.09ArxivdLLM finetuned on discretized 2D driving space
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion2026.02ArxivDiscrete action codebook + masked diffusion
Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving2026.05ArxivBlock-diffusion VLA, speculative scaffold decoding

7. Agentic & Tool-Use dLLMs

New section — emerging line: how dLLMs behave as agents (planning, multi-turn, tool calling). Critical for connecting dLLMs to robotics and physical-AI agent stacks.


8. Theory, Guidance & Applications

8.1 Theory & Analysis

Paper TitleYearVenueRemark
Can Diffusion Model Achieve Better Performance in Text Generation? Bridging the Gap between Training and Inference!2023.05ACL Findings<7B
TEncDM: Understanding the Properties of the Diffusion Model in the Space of Language Model Encodings2024.02AAAI<7B
Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling2024.10ICLR<7B
Theoretical Benefit and Limitation of Diffusion Language Model2025.02NeurIPSTER vs SER analysis
Generalized Interpolating Discrete Diffusion (GIDD)2025.03ICMLNoising
Understanding the Quality-Diversity Trade-off in Diffusion Language Models2025.03ICMLQuality-Diversity Trade-off
Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes2025.05ACL<7B
The Diffusion Duality2025.06ICML<7B, Theoretical Duality
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior2025.07Arxiv<7B
Time Is a Feature: Exploiting Temporal Dynamics in dLLMs2025.08ArxivTemporal focus
Diffusion LLMs Know the Answer Before Decoding2025.08ArxivSemantic focus
What Makes Diffusion Language Models Super Data Learners?2025.10ArxivData efficiency
Why mask diffusion does not work2025.10ArxivFailure analysis
Empirical Analysis of Decoding Biases in Masked Diffusion Models2025.10ArxivDecoding Bias
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models2025.10ArxivSpeed Analysis
On the Role of Discreteness in Diffusion LLMs2025.12ArxivSpeed Analysis
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs2025.10ICLR
Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration2026.03ACLSelf-evaluation, Generalization analysis
On the Role of Discreteness in Diffusion LLMs2025.12ArxivDiscreteness analysis
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs2025.10ICLRBenchmark
Diffusion Language Models are Super Data Learners2025.11ArxivData learner analysis
Adaptation to Intrinsic Dependence in Diffusion Language Models2026.02ArxivDistribution-agnostic schedule theory
Confidence-Based Decoding is Provably Efficient for Diffusion Language Models2026.03ArxivFirst theory of confidence-based decoding
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?2026.02ArxivAR-like decoding analysis, NAP approach
Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects2026.03ArxivMemorization, privacy analysis
Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMs2026.03ArxivLayer skipping, representation analysis
Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison2026.03ArxivControlled AR vs MDM empirical study
Why Gaussian Diffusion Models Fail on Discrete Data?2026.04ArxivMultimodal sampling interval theory
Generative Frontiers: Why Evaluation Matters for Diffusion Language Models2026.04ArxivEvaluation methodology critique
Lost in Diffusion: Uncovering Hallucination Patterns and Failure Modes in Diffusion Large Language Models2026.04ACL FindingsHallucination patterns analysis
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models2026.04ICMLProximity bias analysis
Measuring Temporal Linguistic Emergence in Diffusion Language Models2026.04ArxivTemporal probing, linguistic emergence
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data2026.04ArxivAssociative memory theory
Understanding and Accelerating the Training of Masked Diffusion Language Models2026.05ArxivBell-shaped time sampling, training speed
Uncertainty Quantification for Large Language Diffusion Models2026.05ArxivUQ, hallucination detection for dLLMs
Continuous Language Diffusion as a Decoder-Interface Problem2026.06Arxiv-
Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens2026.06ArxivMoE
Diffusion Language Models: An Experimental Analysis2026.06ArxivUnmasking order
Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs2026.06ArxivUnmasking order
When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs2026.06ArxivCalibrating LoRA Monitors for Masked Diffusion
Understanding Evaluation Illusion in Diffusion Large Language Models2026.06Arxiv-
CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models2026.06ArxivRemasking, Unmasking order
Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization2026.07FRUCTStaged codec-vs-generation bottleneck diagnosis; project
Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs2026.07ArxivA One-Dimensional Self-Conditioning Attractor in Continuous
Subliminal Clocks: Latent Time Modelling in Diffusion Language Models2026.07ArxivLatent Time Modelling in Diffusion Language
Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting2026.07ArxivSpeculative decoding
Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models2026.07ArxivA Mechanistic Analysis of In-Context Learning
Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models2026.07ArxivSafety attack
Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models2026.07ArxivTraining-free, KV cache
Answer First, Reason Later: When Commitment Order Costs Accuracy in Diffusion Language Models2026.08ArxivWhen Commitment Order Costs Accuracy in
Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models2026.08ArxivWhy Predictive Feedback Fails in Diffusion
Scaling Inherently Interpretable Language Models2026.08Arxiv-
Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models2026.08ArxivUncovering the Representation-Confidence Gap in Diffusion
Minimax Optimality of Score-Entropy Discrete Diffusion2026.08Arxiv-
Conditional Total Correlation and the Serial Depth of Adaptive Parallel Sampling2026.08Arxiv-

8.2 Guidance & Downstream Applications

Paper TitleYearVenueRemark
DiffusEmp: A Diffusion Model-Based Framework with Multi-Grained Control for Empathetic Response Generation2023.06ACLDialogue
DiffuDetox: A Mixed Diffusion Model for Text Detoxification2023.06ACL FindingsDetoxification
PoetryDiffusion: Towards Joint Semantic and Metrical Manipulation in Poetry Generation2023.06AAAIPoetry Generation
ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style Transfer2023.08AAAIText Style Transfer
P^3SUM: Preserving Author's Perspective in News Summarization with Diffusion Language Models2023.11NAACLSummarization
DiffuCOMET: Contextual Commonsense Knowledge Diffusion2024.02ACLCommonsense
DiffusionDialog: A Diffusion Model for Diverse Dialog Generation with Latent Space2024.04LREC-COLINGDialogue
Diffusion Guided Language Modeling2024.08ACL FindingsControl
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models2024.11ACL FindingsData Synthesis
Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language Models2024.12ACLText Segmentation
EdiText: Controllable Coarse-to-Fine Text Editing with Diffusion Language Models2025.02ACLText Editing
Constrained Discrete Diffusion2025.03NeurIPSConstraint
Planning with Diffusion Models for Target-Oriented Dialogue Systems2025.04ACLDialogue
CtrlDiff: Boosting dLLMs with Dynamic Block Prediction2025.05ArxivControl
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective2025.05ArxivEmbedding
DINGO: Constrained Inference for Diffusion LLMs2025.05ArxivConstrained Decoding
Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design2025.05ICLRSMC test-time scaling
Mercury: Ultra-Fast Language Models Based on Diffusion2025.06ArxivCode
DiffuCoder: Improving Masked Diffusion for Code Generation2025.06ArxivCode
Unveiling the Potential of Diffusion Large Language Model in Controllable Generation2025.07ArxivControl
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement2025.07ArxivSummarization
Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling2025.08ArxivText Style Transfer
Seed Diffusion: Large-Scale dLLM with High-Speed Inference2025.08ArxivCode
TreeDiff: AST-Guided Code Generation with Diffusion LLMs2025.08ArxivCode (syntax-aware)
Beyond Autoregression: Empirical Study for Code Generation2025.09ArxivCode
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models2025.09ArxivControl
Syntax-Guided Diffusion Language Models with User-Integrated Personalization2025.10ArxivPersonalization
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models2025.10ArxivHallucination
Don't Let It Fade: Preserving Edits via Token Timestep Allocation2025.10NeurIPSControl
Diffusion Language Models for Speech Recognition2026.04ArxivASR rescoring (MDLM/USDM)
CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation2026.04ArxivMolecular generation
TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion2026.02ArxivTabular generation, masked diffusion
Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models2026.03ArxivRAG, retrieval-prior conflict handling
DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning2026.03EMNLP FindingsHallucination detection
Unlocking Prompt Infilling Capability for Diffusion Language Models2026.04ArxivPrompt infilling via full-sequence masking
DiffuMask: Diffusion Language Model for Token-level Prompt Pruning2026.04ArxivPrompt compression
BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning2026.04ArxivMolecule generation + captioning
HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models2026.04ArxivHallucination detection, denoising dynamics
Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks2026.05ArxivWatermark attack, security
DiffRetriever: Parallel Representative Tokens for Retrieval with Diffusion Language Models2026.05ArxivDense retrieval with dLLMs
Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models2026.05ArxivDynamic CFG via RL
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models2026.05ArxivAdaptive guidance schedule, SAE analysis
Constrained Code Generation with Discrete Diffusion2026.05ArxivNeurosymbolic constrained code generation
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA2026.05ArxivPrompt compression study
Machine Unlearning for Masked Diffusion Language Models2026.05ArxivMDU, unlearning framework
Knowledge Editing in Masked Diffusion Language Models2026.06ArxivUnmasking order, Knowledge editing
MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models2026.06ArxivSafety attack
Global Sketch-Based Watermarking for Diffusion Language Models2026.06ArxivWatermarking
Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models2026.06ACLTraining-free
Self-Augmenting Retrieval for Diffusion Language Models2026.06ICMLTraining-free, Serving
TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering2026.06ArxivAutomatic In-place Text Sequence Modification via
Detect, Remask, Repair: Diffusion Editing for Faithful Summarization of Evolving Contexts2026.06ArxivFew-step, Remasking
TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models2026.06ArxivMoE, Training-free
Self-Generated Error Training for Token Editing in Diffusion Language Models2026.06Arxiv-
TAG-DLM: Diffusion Language Models for Text-Attributed Graph Learning2026.06ArxivDiffusion Language Models for Text-Attributed Graph
TRE: Training-Free Hallucination Detection for Diffusion Language Models2026.06ArxivTraining-free, Hallucination
Diffusion-GR2: Diffusion Generative Reasoning Re-ranker2026.07ArxivDistillation, Serving
Discrete Diffusion Language Models for Interactive Radiology Report Drafting2026.07ArxivMoE, Clinical
Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata2026.07ArxivRemasking, Block diffusion
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model2026.07ArxivMoE
Diffusion Language Model for Recommendation2026.07Arxiv-
Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance2026.07ArxivTraining-free
DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models2026.07ArxivHallucination
EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning2026.08ArxivRemasking, dMLLM
Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion2026.08ArxivCharacter-Level Masked Diffusion for Ancient Greek
Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits2026.08ArxivSafety attack
Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models2026.08ArxivWhen Classifier-Free Guidance Becomes Unnecessary in
Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression2026.08ArxivServing, Compression
Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo2026.08Arxiv-
SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel Fields2026.08EMNLP FindingsWatermarking, Unmasking order
Length-Adaptive Decoding for Masked Diffusion Machine Translation2026.08EMNLPTraining-free, Unmasking order
DRRG: A Discrete Diffusion Framework for Radiology Report Generation2026.08ArxivClinical

9. Seminal Diffusion Papers


🤝 Contact

diffusion
diffusion-language-models
diffusion-model
diffusion-models
large-language-model
large-language-models

Contributors

KIM-JAKE

83 commits

Darklightened

22 commits

celve

2 commits

xiazhi1

2 commits

AIDASLab/Awesome-Diffusion-LLM

A comprehensive list of papers about Large-Language-Diffusion-Models.

103

119 commits

updated Sep 1, 2026

See the code

README

Awesome-Large-Language-Diffusion-Models

Awesome Maintained

A comprehensive and structured list of research papers about Large-Language-Diffusion-Models (dLLMs).

Last major update: September 2026 — added 169 new papers from Jun–Aug 2026.


⚙️ Framework (Taxonomy)

  1. Surveys & Useful Resources
  2. Core Methodologies
  3. Reasoning & Policy Optimization
  4. Token Ordering & Generation Strategies
  5. System Efficiency & Acceleration
  6. Multi-modal & Physical AI
  7. Agentic & Tool-Use dLLMs
  8. Theory, Guidance & Applications
  9. Seminal Diffusion Papers

1. Surveys & Useful Resources

📚 Blogs & Reports

📝 Survey & Perspective Papers


2. Core Methodologies

2.1 Discrete & Masked Diffusion

Paper TitleYearVenueRemark
DiffusER: Discrete Diffusion via Edit-based Reconstruction2022.10ICLR<7B
SSD-LM: Semi-autoregressive Simplex-based Diffusion for Modular Control2022.10ACL<7B, Simplex
DiffusionBERT: Improving Generative Masked Language Models2022.11ACL<7B, Masked
A Reparameterized Discrete Diffusion Model for Text Generation2023.02COLM<7B
David helps Goliath: Inference-Time Collaboration Between Small and Large Diffusion LMs2023.05NAACL>7B, Scale-collaboration
TESS: Text-to-Text Self-Conditioned Simplex Diffusion2023.05EACL<7B, Simplex
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning2023.08Arxiv>7B, Scaling
Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution (SEDD)2023.10ICML<7B, Discrete
Simplified and Generalized Masked Diffusion for Discrete Data (MD4)2024.06NeurIPS-
Simple and Effective Masked Diffusion Language Models (MDLM)2024.06NeurIPS<7B, Masked
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data (RADD)2024.06ICLR<7B, Masked
Scaling up Masked Diffusion Models on Text (SMDM)2024.10ICLR<7B, 1.1B Scaling
Energy-Based Diffusion Language Models for Text Generation (EDLM)2024.10ICLR<7B
Conditional MASK Discrete Diffusion Language Model2024.11EMNLP<7B
Non-Markovian Discrete Diffusion with Causal Language Models2025.02NeurIPS<7B
Large Language Diffusion Models (LLaDA)2025.02NeurIPS>7B, LLaDA-8B
Anchored Diffusion Language Model (ADLM)2025.05NeurIPS>7B; ANELBO objective
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs2025.06AAAI>7B, Context Scaling
Esoteric Language Models (Eso-LMs)2025.06ICMLAR + MDM hybrid
Dream 7B: Diffusion Large Language Models2025.08Arxiv>7B, Dream-7B
Sequential Diffusion Language Models2025.09Arxiv>7B
LLaDA-MoE: A Sparse MoE Diffusion Language Model2025.09Arxiv>7B, 7B-A1B MoE from scratch
UltraLLaDA: Scaling Context to 128K2025.10Arxiv>7B, Context Scaling
Next Semantic Scale Prediction via Hierarchical Diffusion Language Models2025.10NeurIPS-
Masked Diffusion Models as Energy Minimization2025.10NeurIPS<7B
Soft-Masked Diffusion Language Models2025.10ICLR<7B
Variational Masked Diffusion Models2025.10Arxiv<7B
Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the Way2025.10Arxiv>7B, Variable Length
Diffusion Language Models are Super Data Learners2025.11ArxivData efficiency
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone2025.11ArxivNon-Transformer Backbone
TiDAR: Think in Diffusion, Talk in Autoregression2025.11Arxiv>7B
C2DLM: Causal Concept-Guided Diffusion Large Language Models2025.11Arxiv>7B
Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models2026.01ACLSoft tokens, Masked
LLaDA2.0: Scaling Up Diffusion Language Models to 100B2025.12Arxiv>100B, MoE; Ant Group
LLaDA2.1: Speeding Up Text Diffusion via Token Editing2026.02ArxivEditable State Evolution
Introspective Diffusion Language Models (I-DLM)2026.04ArxivIntrospective consistency
W1-4B-dLLM (WhaletechAI)2026.04HF Model4B open dLLM; demo
Scaling Beyond Masked Diffusion Language Models2026.02ArxivUniform-state & interpolating diffusion scaling
dLLM: Simple Diffusion Language Modeling2026.02ArxivUnified open-source dLLM framework
Generalized Discrete Diffusion from Snapshots2026.03ArxivUnified arbitrary noising framework
Diffutron: A Masked Diffusion Language Model for Turkish Language2026.03ArxivMultilingual, Turkish MDM
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models2026.04COLMMoE, Expert-choice routing
Rethinking Token Prediction: Tree-Structured Diffusion Language Model2026.04ArxivTree-structured token prediction
Drifting Objectives for Refining Discrete Diffusion Language Models2026.05ArxivTokenDrift, anti-symmetric objective
Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement2026.06Arxiv-
Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design2026.06ArxivImproving Diffusion Language Models through Bias-variance
VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination2026.06ArxivCode
Sumi: Open Uniform Diffusion Language Model from Scratch2026.06ArxivOpen Uniform Diffusion Language Model from
Improved Large Language Diffusion Models2026.06Arxiv-
Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation2026.06ArxivKV cache, Serving
Tensor-Train Joint Modeling for Few-Step Discrete Diffusion2026.07ArxivFew-step, Unmasking order
PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention2026.07ArxivPretrained Discrete Masked Diffusion Language Modeling
DiffusionGemma Technical Report2026.07ArxivMoE, Speculative decoding
Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy2026.07ArxivPosterior-Mean Denoisers for Score Entropy
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models2026.08ArxivMoE
MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models2026.08ArxivDistribution Aware Positional Encoding for Masked
Retrofitting Linear Attention into Diffusion Language Models2026.08ArxivBlock diffusion, Serving
Reducing Pretraining-Generation Mismatch in Diffusion Language Models2026.08Arxiv-

2.2 Continuous & Latent Space Diffusion

Paper TitleYearVenueRemark
Diffusion-LM Improves Controllable Text Generation2022.05NeurIPS<7B, Embedding
DiffuSeq: Sequence to Sequence Text Generation2022.10ICLR<7B, Embedding
Latent Diffusion for Language Generation2022.12NeurIPS<7B, Latent
Diffusion Glancing Transformer for Parallel Sequence to Sequence Learning2022.12NAACL<7B
Empowering Diffusion Models on the Embedding Space for Text Generation2022.12NAACL<7B, Embedding
Text Generation with Diffusion Language Models: A Pre-training Approach with Continuous Paragraph Denoise2022.12ICML<7B, Embedding
DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises2023.02TACL<7B, Embedding
Likelihood-Based Diffusion Language Models (Plaid)2023.05NeurIPS<7B, Plaid 1B
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model2023.06NeurIPS<7B, Latent
Edit Flows: Flow Matching with Edit Operations2025.06Arxiv-
Coevolutionary Continuous Discrete Diffusion: Latent Reasoner2025.10ICML>7B; CCDD
Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning2026.02ArxivLatent planning + AR hybrid
CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think2026.03ArxivContextual AR decoder for continuous diffusion
LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling2026.04ArxivFlow matching via Bregman divergence
Scaling Properties of Continuous Diffusion Spoken Language Models2026.04ArxivContinuous diffusion SLM, scaling laws
Towards Closing the Autoregressive Gap via Entropy-Gated Continuous Bitstream Diffusion2026.05ArxivContinuous bitstream diffusion
TextLDM: Language Modeling with Continuous Latent Diffusion2026.05ArxivDiT-style flow matching for text
How to Train Your Latent Diffusion Language Model Jointly With the Latent Space2026.05ArxivJoint latent encoder+diffusion training
BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion2026.05ArxivBitwise continuous diffusion head
Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space2026.05ArxivHJB-based latent optimal control
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language2026.05ArxivRePlaid scaling law, continuous vs discrete
Simplex Relaxation for Discrete Diffusion2026.08Arxiv-

2.3 AR-to-Diffusion Adaptation

2.4 Hybrid AR-Diffusion (Block / Forcing)

A new section: hybrids that interleave block-level AR with intra-block diffusion, or "forcing" approaches that retain causal masks for KV-cache reuse.

Paper TitleYearVenueRemark
Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models (BD3-LM)2025.03ICLR<7B, Interpolation
D2F: Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing2025.08ICLR>7B, Faster-than-AR
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding2025.08Arxiv>7B
SDAR: Synergistic Diffusion-AutoRegression Paradigm2025.10Arxiv>7B, Block hybrid
Encoder-Decoder Block Diffusion Language Models for Efficient Training and Inference (E2D2)2025.10NeurIPSBlock Enc-Dec
Fast-dLLM v2: Efficient Block-Diffusion LLM2025.09Arxiv>7B, Block Decoding
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference2025.12ArxivCausal-attn diffusion
ReFusion: Diffusion LLM with Parallel Autoregressive Decoding2025.12ArxivSlot-level interleaving
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models2026.02ArxivAdaptive block
DFlash: Block Diffusion for Flash Speculative Decoding2026.02ICMLBlock + speculative
Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models2026.04ACLAnchor-based cross-block decoding
When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language Models2026.04ArxivVariable-size blocks
Dynamic Chunking for Diffusion Language Models2026.05ArxivContent-defined semantic chunks
FLARE: Diffusion for Hybrid Language Model2026.06ArxivServing
BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers2026.06ArxivFew-step, Block diffusion
SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs2026.06ArxivBlock diffusion
Multi-Block Diffusion Language Models2026.06ArxivBlock diffusion
Adaptive Block Diffusion: Resolving Training-Inference Mismatch in Diffusion Language Models2026.06ArxivBlock diffusion
Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models2026.06ArxivTraining-free, KV cache
Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding2026.07ICMLKV cache, Block diffusion
Training Hybrid Block Diffusion Language Models with Partial Bidirectionality2026.07ArxivBlock diffusion, Serving
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding2026.07ArxivServing

3. Reasoning & Policy Optimization

3.1 Reasoning & Planning

Paper TitleYearVenueRemark
Diffusion of Thought: Chain-of-Thought Reasoning in dLLMs2024.02NeurIPS<7B, CoT Foundation
Beyond Autoregression: Discrete Diffusion for Complex Reasoning2024.10ICLR<7B
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models2025.09ArxivPlanning
d1: Scaling Reasoning in dLLMs via RL2025.04NeurIPS>7B, Reasoning scaling
Reinforcing the Diffusion Chain of Lateral Thought2025.05NeurIPS>7B
Thinking Inside the Mask: In-Place Prompting in dLLMs2025.08Arxiv>7B
Reinforced Context Order Recovery for Adaptive Reasoning2025.08Arxiv<7B, Planning
d2: Improved Techniques for Training Reasoning dLLMs2025.09Arxiv>7B
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning2025.10Arxiv>7B
Beyond Surface Reasoning: Unveiling Long CoT Capacity2025.10Arxiv>7B
Coevolutionary Continuous Discrete Diffusion: Latent Reasoner2025.10ICML>7B
On the Reasoning Abilities of Masked Diffusion Language Models2025.10Arxiv>7B
Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning2025.10ArxivCollaboration
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning2025.10Arxiv>7B
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching2026.02ArxivStep-level rationale stitching
Reasoning or Rationalization? The Role of Justifications in Masked Diffusion Models for Fact Verification2026.03ArxivCoT dynamics analysis
Diffusion LLMs can think EoS-by-EoS2026.03ArxivEoS-guided reasoning via padding
LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language Models2026.03ArxivLogic-guided unmasking order
Learnability-Informed Fine-Tuning of Diffusion Language Models2026.05ArxivLIFT, SFT with learnability schedule
d-OPSD: On-Policy Self-Distillation for Diffusion Language Models2026.06ArxivOn-policy self-distillation, Code
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models2026.06Arxiv-
DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models2026.06Arxiv8B, Block diffusion
Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation2026.06ArxivBlock diffusion
Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models2026.06ArxivUnmasking order
Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs2026.08ArxivTraining-free, Unmasking order
Semantic Reasoning Denoising: Correcting Language Model Reasoning with Semantic Operators2026.08ArxivCorrecting Language Model Reasoning with Semantic
DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models2026.08ArxivDraft-Conditioned Global Correction for Complex Reasoning

3.2 Alignment & Reinforcement Learning

Paper TitleYearVenueRemark
Preference-Based Alignment of Discrete Diffusion Models2025.03Arxiv>7B
DiFFPO: Training dLLMs to Reason Fast and Furious via RL2025.10Arxiv>7B, Direct Preference
LLaDA 1.5: Variance-Reduced Preference Optimization2025.05Arxiv>7B
wd1: Weighted Policy Optimization for Reasoning2025.07ICLR>7B
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position2025.08AAAI>7B, Safety
Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation2025.07ArxivSafety
The Devil behind the mask: An emergent safety vulnerability2025.07ICLRSafety
MDPO: Overcoming the Training-Inference Divide2025.08Arxiv>7B
Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs2025.08EMNLP>7B
Inpainting-Guided Policy Optimization for dLLMs2025.09Arxiv>7B
Taming Masked Diffusion via Consistency Trajectory RL2025.09Arxiv>7B
TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning2025.09Arxiv>7B
Revolutionizing RL Framework for Diffusion Large Language Models2025.09Arxiv>7B
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models2025.09ICLRSafety
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models2025.09ArxivSafety
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance2025.09Arxiv>7B
AGRPO: Simple Policy Gradients for Reasoning with Diffusion Language Models2025.10Arxiv>7B
Improving Reasoning via Group Diffusion Policy Optimization (GDPO)2025.10Arxiv>7B
Step-Aware Policy Optimization for Reasoning2025.10Arxiv>7B
MRO: Enhancing Reasoning via Multi-Reward Optimization2025.10NeurIPS>7B
Enhancing Reasoning via Distribution Matching Policy Optimization2025.10Arxiv>7B
Boundary-Guided Policy Optimization for Memory-efficient RL2025.10Arxiv>7B
SPG: Sandwiched Policy Gradient for Masked Diffusion2025.10Arxiv>7B
Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies2025.10ICLR>7B
Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States2025.10Arxiv>7B
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective2025.12Arxiv>7B
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models2025.12Arxiv>7B
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor2026.04ArxivUnified RL framework
DiRL: An Efficient Post-Training Framework for Diffusion Language Models2025.12ArxivPost-training
Efficient and Stable Reinforcement Learning for Diffusion Language Models2026.02ArxivVariance reduction
Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation2026.01ArxivMulti-agent RL
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages2026.03ArxivMDP formulation, entropy-guided steps
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models2026.04ArxivTrajectory-ranked SFT
Relative Score Policy Optimization for Diffusion Language Models2026.05ArxivRSPO, RLVR for dLLMs
Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models2026.05ArxivSafety, contrastive steering
Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models2026.05ArxivTraFL, trajectory-balance objective
Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models2026.06ArxivMoE, Unmasking order
Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models2026.06ArxivRL
A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding2026.06ArxivUnmasking order
SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing2026.06ArxivTraining-free, RL
A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models2026.07ArxivRL
Mask-Aware Policy Gradients for Diffusion Language Models2026.07COLMRemasking, Unmasking order
Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models2026.08ArxivRL

4. Token Ordering & Generation Strategies

Paper TitleYearVenueRemark
SSD-LM: Semi-autoregressive Simplex-based Diffusion for Modular Control2022.10ACL<7B, Blockwise
AR-Diffusion: Auto-Regressive Diffusion Model for Text Generation2023.05NeurIPS<7B, AR-like noise
Train for the Worst, Plan for the Best: Understanding Token Ordering2025.02ICML<7B, Ordering Analysis
Block Diffusion: Interpolating Between Autoregressive and Diffusion LMs2025.03ICLR<7B, Interpolation
Review, Remask, Refine (R3): Process-Guided Block Diffusion2025.07ICML MOSS>7B, Block-wise
Any-Order Flexible Length Masked Diffusion2025.09Arxiv<7B, Order Flexibility
Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models2025.09Arxiv>7B, Remasking
Don't Let It Fade: Preserving Edits via Token Timestep Allocation2025.10NeurIPS<7B, Edit preservation
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models2025.10Arxiv>7B, Unmasking
Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies2025.10ICLR>7B, Unmasking
Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing2025.10Arxiv>7B, Unmasking
Diffusion Language Model Inference with Monte Carlo Tree Search2025.12Arxiv>7B, MCTS
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty2025.12Arxiv>7B, Unmasking
Adaptation to Intrinsic Dependence in Diffusion Language Models2026.02ArxivDistribution-agnostic schedule
Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration2026.03ACLSelf-evaluation, Flexible length
D5P4: Partition Determinantal Point Process for Diversity in Parallel Discrete Diffusion Decoding2026.03ArxivDiversity-aware decoding
Improving Sampling for Masked Diffusion Models via Information Gain2026.02ArxivInfo-Gain sampler
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models2026.03ArxivDependency-aware unmasking
Diffusion Language Models Are Natively Length-Aware2026.03ArxivLength-aware EoS generation
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models2026.04ArxivQuality vs exploration trade-off
Remask, Don't Replace: Token-to-Mask Refinement in Masked Diffusion Language Models2026.04ArxivT2M refinement, LLaDA2.1 analysis
Edit-Based Refinement for Parallel Masked Diffusion Language Models2026.05ICMLME-DLM, edit-based post-correction
When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models2026.05ArxivSuffix anchor, confidence modulation
Supportive Token Revealing for Fast Diffusion Language Model Decoding2026.06ArxivTraining-free
NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models2026.06ArxivRemasking, Unmasking order
Re-evaluating Confidence Remasking in Masked Diffusion Language Models2026.06ArxivTraining-free, Remasking
Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models2026.06ACLUnmasking order, RL
Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models2026.06Arxiv-
Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens2026.06ArxivTraining-free, Remasking
When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models2026.06ArxivNoise Level as a Granularity Axis
TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding2026.07ArxivTraining-free
Don't Commit Alone: Joint Token Commitment in Diffusion Language Models2026.07ArxivJoint Token Commitment in Diffusion Language
Reinforcing the Generation Order of Multimodal Masked Diffusion Models2026.07ArxivRL, dMLLM
ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding2026.07ICMLTraining-free, Unmasking order
Rethinking the Generation Order of Block Diffusion Language Models2026.07ArxivTraining-free, Unmasking order
Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion Language Models2026.07ArxivCoordinating Adaptive Sampling and Early Exit
Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs2026.08EMNLPdMLLM, Context-aware token ordering, Code
Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models2026.08ArxivTraining-free, Unmasking order
Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference2026.08ArxivTraining-free, Remasking
Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models2026.08ArxivUnmasking order, dMLLM
Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs2026.08EMNLP FindingsTraining-free, Hallucination

5. System Efficiency & Acceleration

5.1 Caching & Memory Strategy

Paper TitleYearVenueRemark
dKV-Cache: The Cache for Diffusion Language Models2025.05NeurIPS>7B
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion2025.05Arxiv>7B
Fast-dLLM: Training-free Acceleration via KV Cache + Parallel Decoding2025.05ArxivNVIDIA; KV cache + parallel
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching2025.06ICML>7B
d^2Cache: Accelerating via Dual Adaptive Caching2025.09ICLR>7B
Attention Is All You Need for KV Cache in dLLMs2025.10Arxiv>7B
Attention Sinks in Diffusion Language Models2025.10Arxiv>7B
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference2025.12Arxiv>7B, Causal cache
Stop the Flip-Flop: Context-Preserving Verification for Fast Revocable Diffusion Decoding (COVER)2026.02ArxivKV-override verification
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing2026.02ArxivLong-context sparsity
Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming2026.01ArxivLong-context memory
Residual Context Diffusion Language Models2026.01ArxivRecycle discarded tokens
MAGE: All-[MASK] Block Already Knows Where to Look in Diffusion LLM2026.02ArxivMASK-guided sparse attention, block dLLM
MetaState: Persistent Working Memory for Discrete Diffusion Language Models2026.03ArxivGRU-style cross-step memory
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention2026.03ICMLSaliency-based partial attention
EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models2026.03ArxivEntropy-guided KV cache refresh
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models2026.04ArxivLocality-aware sparse KV, block dLLM
PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models2026.05ArxivColumn-sparse attention, periodic refresh
Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference2026.06ICML Workshop
Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models2026.06EMNLPTraining-free, Long context
HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval2026.06ArxivKV cache, Block diffusion
Affix Cache for Diffusion Large Language Models2026.06ArxivServing
LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models2026.07ArxivTraining-free, Quantization
Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models2026.08ArxivTraining-free

5.2 Decoding & Sampling

Paper TitleYearVenueRemark
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion2024.08NAACL<7B, Speculative Decoding
Wide-In, Narrow-Out: Revokable Decoding for Effective dLLMs2025.07Arxiv>7B
Accelerating Diffusion LLMs via Adaptive Parallel Decoding (APD)2025.05NeurIPS>7B
DLM-One: Diffusion Language Models for One-Step Generation2025.06Arxiv<7B
Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles2025.06Arxiv>7B
Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models2025.06ICML>7B
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models2025.08Arxiv>7B
DPad: Efficient Diffusion Language Models with Suffix Dropout2025.08Arxiv>7B
Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning2025.09NeurIPS>7B
AdaBlock-dLLM: Semantic-Aware Inference via Adaptive Block Size2025.09ICLR>7B
dParallel: Learnable Parallel Decoding for dLLMs2025.09Arxiv>7B
Learning to Parallel: Accelerating dLLMs via Learnable Parallel Decoding2025.09Arxiv>7B
Spiffy: Multiplying Acceleration via Lossless Speculative Decoding2025.09ICML Workshop>7B, Speculative Decoding
DiffuSpec: Unlocking dLLMs for Speculative Decoding2025.09Arxiv>7B, Speculative Decoding
Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall2025.10ICLR>7B
Saber: Efficient Sampling with Backtracking Enhanced Remasking2025.10ACL>7B
CreditDecoding: Parallel Decoding with Trace Credits2025.10ACL>7B
Accelerating dLLM Inference via Local Determinism Propagation2025.10Arxiv>7B
Self Speculative Decoding for Diffusion Large Language Models2025.10Arxiv>7B, Speculative Decoding
SpecDiff-2: Scaling Diffusion Drafter Alignment2025.11Arxiv>7B, Speculative Decoding
Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models2025.11Arxiv>7B
Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models2025.11Arxiv>7B
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs2025.12Arxiv>7B, Speculative Decoding
Fast-Decoding via Progress-Aware Confidence Schedules2025.12Arxiv>7B
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding2025.12Arxiv>7B
Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models2025.12Arxiv>7B
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference2026.01ArxivSpeculative drafting
DFlash: Block Diffusion for Flash Speculative Decoding2026.02ICMLBlock + speculative
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models2026.02ArxivEntropy-adaptive blocks
Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding2026.02ArxivDiCo, three-phase parallel decoding
Free Lunch for Pass@k? Low Cost Diverse Sampling for Diffusion Language Models2026.03ArxivDiverse sampling, Pass@k
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation2026.03ArxivSelf-speculation, block diffusion
Dependency-Guided Parallel Decoding in Discrete Diffusion Language Models2026.04ArxivDEMASK, dependency predictor
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models2026.04ArxivSpeculative + causal drafter
Accelerating Speculative Decoding with Block Diffusion Draft Trees2026.04ArxivDraft trees for block diffusion
Stability-Weighted Decoding for Diffusion Language Models2026.04ArxivKL-based token stability metric
R²-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction2026.04ArxivSpatial + temporal redundancy reduction
Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast2026.05ArxivSelf-contrast, HD token focus
Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding2026.05ArxivFeF-DLLM, prefix-conditioned factorization
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding2026.05ArxivParallel speculative, hierarchical acceptance
Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers2026.05ArxivWINO revokable parallel decoding
Cost-Aware Diffusion Draft Trees for Speculative Decoding2026.06ArxivSpeculative decoding, Block diffusion
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding2026.06ArxivSpeculative decoding, Block diffusion
SimSD: Simple Speculative Decoding in Diffusion Language Models2026.06ArxivTraining-free, KV cache
SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative Decoding2026.06ArxivBlock diffusion
Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge2026.06ICML-
AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding2026.06ArxivTraining-free, Block diffusion
Unified Energy for Invariant and Independent Decoding in Diffusion Language Models2026.06Arxiv-
Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models2026.06ArxivTraining-free
Teaching Diffusion to Speculate Left-to-Right2026.06ArxivSpeculative decoding
Mean-Field Parallel Decoding for Discrete Diffusion Language Models2026.06ArxivTraining-free
LESS Is More: Mutual-Stability Sampling for Diffusion Language Models2026.06ArxivTraining-free, Unmasking order
Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks2026.06ArxivTraining-free
$x$-Prediction Flow: Efficient Continuous Decoding for Masked Diffusion Language Models2026.06ArxivUnmasking order, RL
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding2026.06ArxivSpeculative decoding
PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding2026.06ArxivSpeculative decoding, Serving
GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring2026.06ArxivSpeculative decoding, Serving
Accelerating Discrete Diffusion Models with Parallel-In-Time Sampling2026.07Arxiv-
DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding2026.07ArxivTraining-free, Speculative decoding
Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models2026.07ArxivFew-step
FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models2026.07ArxivTraining-free, KV cache
AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters2026.07ArxivSpeculative decoding, Distillation
AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding2026.07ArxivSpeculative decoding, Serving
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models2026.07ArxivTraining-free, Speculative decoding
CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference2026.07ArxivTraining-free, Block diffusion
DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models2026.08ArxivTraining-free, Compression
xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding2026.08ArxivSpeculative decoding, Serving
DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding2026.08ArxivSpeculative decoding, Block diffusion
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization2026.08ArxivTraining-free, Speculative decoding
CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing2026.08ArxivDistillation
From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding2026.08ArxivSpeculative decoding
LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding2026.08ArxivSpeculative decoding, Serving
CAI-DLLM: Convergence Aware Inference for Diffusion Language Models2026.08ArxivTraining-free, Long context
Accelerating Diffusion Language Models via Structured Suffix Modeling2026.08ArxivTraining-free, KV cache
Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models2026.08ArxivUnmasking order
Survival-Guided Length Control for Efficient Diffusion Language Models2026.08EMNLPTraining-free
Trajectory-Level Speculative Decoding for Diffusion Language Models2026.08ArxivSpeculative decoding, Unmasking order
ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding2026.08ArxivSpeculative decoding, Code
Ceiling-Clipped Acceptance Histograms Indicate Stranded Speed-up in Block-Diffusion Speculative Decoding2026.08ArxivSpeculative decoding
CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models2026.08EMNLP FindingsTraining-free, Block diffusion

5.3 Distillation, Quantization & Sparsity

Paper TitleYearVenueRemark
Beyond Autoregression: Fast LLMs via Self-Distillation Through Time2024.10ICLR<7B, Distillation
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction2025.08Arxiv>7B, Sparsity
DLLMQuant: Quantizing Diffusion-based Large Language Models2025.08Arxiv>7B, Quantization
Quantization Meets dLLMs: Post-training Quantization Study2025.08Arxiv>7B, Quantization
FS-DFM: Few-Step Diffusion Language Model2025.09ICLR>7B
SparseD: Sparse Attention for Diffusion Language Models2025.09Arxiv>7B, Sparsity
LLaDA-MoE: A Sparse MoE Diffusion Language Model2025.09Arxiv>7B, MoE
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct2025.10Arxiv>7B, Distillation
CDLM: Consistency Diffusion Language Models For Faster Sampling2025.11Arxiv>7B, Consistency
Sink-Aware Pruning for Diffusion Language Models2026.02ArxivUnstable sink pruning
FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation2026.04ACL FindingsFew-step distillation, S2S
On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks2026.04ArxivGPTQ/HAWQ on code dLLMs
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models2026.04ArxivCross-architecture dLLM distillation
TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM2026.05ArxivTrajectory self-distillation
Infinite Mask Diffusion for Few-Step Distillation2026.05ArxivIMDM, stochastic infinite-state mask
Self-Distilled Trajectory-Aware Boltzmann Modeling for Diffusion Language Models2026.05ArxivTABOM, Boltzmann ranking objective
DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling2026.05ArxivLatent + consistency distillation
STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models2026.06ArxivQuantization, Unmasking order
FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models2026.06ICMLQuantization
Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation2026.07ArxivTraining-free, Serving
Trace-Based On-Policy Distillation for Masked Diffusion Language Models2026.07ArxivDistillation, RL
Multi-Mask Diffusion Language Models for Few-Step Generation2026.07ArxivDistillation, Few-step
Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising2026.07ArxivBlock diffusion, Serving
REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models2026.08ArxivMoE, Training-free
OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models2026.08ArxivDistillation, Few-step
SelFusion: Self-distillation for Diffusion Language Models2026.08ACLDistillation

5.4 Inference Frameworks & Systems

New section: production-grade frameworks and runtime engineering for dLLMs.

Paper TitleYearVenueRemark
dlmserve2026.05RepoFirst OSS serving engine for diffusion LMs (LLaDA family); OpenAI-compatible HTTP, step-level batching (2.5x HF), LocalLeap (1.8x). MIT.
FOCUS: DLLMs Know How to Tame Their Compute Bound2026.01ICMLTraining-free inference system; token eviction for higher throughput
dInfer: An Efficient Inference Framework for Diffusion Language Models2025.10ArxivModular framework, >1100 TPS
JetEngine (SDAR)2025.10RepoLightweight engine for SDAR (3700+ TPS on H200)
Mercury: Ultra-Fast Language Models Based on Diffusion2025.06ArxivInception Labs commercial dLLM
Seed Diffusion: Large-Scale dLLM with High-Speed Inference2025.08ArxivByteDance code-focused dLLM
TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload2026.05ArxivMoE expert offload, lossless
Efficient On-Device Diffusion LLM Inference with Mobile NPU2026.06ArxivKV cache, Speculative decoding
DiLaServe: High SLO Attainment Serving for Diffusion Language Models2026.06ArxivServing
Sangam: Efficiently Serving Diffusion LLMs with the AR Stack2026.07ArxivServing
BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving2026.07ArxivServing
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware2026.08ArxivServing

6. Multi-modal & Physical AI

6.1 Multi-modal dLLMs

Paper TitleYearVenueRemark
Dual Diffusion for Unified Image Generation and Understanding2025.01ArxivUnified Task
Unified Multimodal Discrete Diffusion (UniDisc)2025.03ArxivUnified Diffusion
LaViDa: A Large Diffusion LLM for Multimodal Understanding2025.05NeurIPS SpotlightUnderstanding
MMaDA: Multimodal Large Diffusion Language Models2025.05NeurIPSNative Multimodal
Dimple: Discrete Diffusion Multimodal LLM with Parallel Decoding2025.05ArxivParallel Multimodal
LLaDA-V: Diffusion LLMs with Visual Instruction Tuning2025.06ArxivVisual Tuning
Muddit: Liberating Generation Beyond Text-to-Image2025.05ICLRMulti-modal
Show-o2: Improved Native Unified Multimodal Models2025.06ArxivUnified Generation
Diffuse Everything: Multimodal Diffusion on Arbitrary Spaces2025.06ICMLArbitrary Spaces
TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning2025.08ArxivTencent ladder-side tuning
Lumina-DiMOO: Omni Diffusion LLM for Generation2025.10ArxivOmni-generation
MMaDA-Parallel: Thinking-Aware Editing and Generation2025.11ArxivParallel Multimodal
DiffusionVL: Translating AR Models into Diffusion VL Models2025.12ArxivVL Adaptation
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding2025.12ArxivBlock-diffusion VL
Dream-VL: Open Vision-Language Model with Diffusion Backbone2025.12ArxivdVLM from Dream-7B
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models2026.02ArxivUnified RL post-training
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion2026.03ICMLAny-to-any (text/speech/image)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation2026.04ArxivSigLIP-VQ + block diffusion
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM2026.04ArxivAR-VLM → block-diffusion VLM
Analyzing Diffusion and Autoregressive VLMs in Multimodal Embedding Space2026.02ArxivEmbedding analysis
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model2026.03ArxivOmnimodal
UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning2026.06ArxivUnified Audio-Text Diffusion for Audio Generation,
Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model2026.06ArxivRL, dMLLM
PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models2026.06ArxivdMLLM
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes2026.07ArxivTraining-free, Remasking
Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?2026.08ArxivTraining-free, Retrieval

6.2 Vision-Language-Action (VLA)

Scope note: this section covers VLA models that use a diffusion/masked-diffusion language model as the backbone (dVLM-based VLA) or apply discrete diffusion as the action-decoding mechanism (not continuous diffusion action heads grafted onto an AR VLM). Pure continuous-diffusion-policy VLAs such as DiVLA (Wen et al., 2024), HybridVLA, and ProgressVLA are intentionally excluded because their language model is autoregressive — only the action head is diffusion-based.

(a) dVLM-backbone VLA — language backbone itself is a diffusion language model.

Paper TitleYearVenueRemark
LLaDA-VLA: Vision Language Diffusion Action Models2025.09ArxivFirst LLaDA(d-VLM)-based VLA
dVLA: Diffusion VLA with Multimodal Chain-of-Thought2025.09ArxivdLLM backbone + multimodal CoT
Dream-VLA: Open Vision-Language-Action Model with Diffusion Backbone2025.12ArxivdVLA from Dream-7B; first dLLM pretrained VLA
MMaDA-VLA: Large Diffusion VLA with Unified Multi-Modal Instruction and Generation2026.03ArxivNative discrete-diffusion VLA from MMaDA

(b) Discrete-diffusion action decoding — language backbone may still be AR-VLM, but action chunks are decoded via discrete diffusion. Closely tied to dLLM literature for inference techniques.

Paper TitleYearVenueRemark
Discrete Diffusion VLA: Action Decoding in VLA Policies2025.08ICMLUnified-transformer + discrete-diffusion actions
E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion2025.11ArxivAR-VLM backbone + Tweedie discrete diffusion on action tokens

6.3 Autonomous Driving / World Models

Scope note: works that apply discrete diffusion / masked-diffusion language modeling to driving trajectories, action codebooks, or tokenized world states. Continuous trajectory-diffusion planners (e.g., classical Diffusion Policy applied to driving) are out of scope.

Paper TitleYearVenueRemark
Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion2023.11ICLRDiscrete diffusion on tokenized point-cloud world model
ReflectDrive: Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving2025.09ArxivdLLM finetuned on discretized 2D driving space
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion2026.02ArxivDiscrete action codebook + masked diffusion
Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving2026.05ArxivBlock-diffusion VLA, speculative scaffold decoding

7. Agentic & Tool-Use dLLMs

New section — emerging line: how dLLMs behave as agents (planning, multi-turn, tool calling). Critical for connecting dLLMs to robotics and physical-AI agent stacks.


8. Theory, Guidance & Applications

8.1 Theory & Analysis

Paper TitleYearVenueRemark
Can Diffusion Model Achieve Better Performance in Text Generation? Bridging the Gap between Training and Inference!2023.05ACL Findings<7B
TEncDM: Understanding the Properties of the Diffusion Model in the Space of Language Model Encodings2024.02AAAI<7B
Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling2024.10ICLR<7B
Theoretical Benefit and Limitation of Diffusion Language Model2025.02NeurIPSTER vs SER analysis
Generalized Interpolating Discrete Diffusion (GIDD)2025.03ICMLNoising
Understanding the Quality-Diversity Trade-off in Diffusion Language Models2025.03ICMLQuality-Diversity Trade-off
Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes2025.05ACL<7B
The Diffusion Duality2025.06ICML<7B, Theoretical Duality
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior2025.07Arxiv<7B
Time Is a Feature: Exploiting Temporal Dynamics in dLLMs2025.08ArxivTemporal focus
Diffusion LLMs Know the Answer Before Decoding2025.08ArxivSemantic focus
What Makes Diffusion Language Models Super Data Learners?2025.10ArxivData efficiency
Why mask diffusion does not work2025.10ArxivFailure analysis
Empirical Analysis of Decoding Biases in Masked Diffusion Models2025.10ArxivDecoding Bias
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models2025.10ArxivSpeed Analysis
On the Role of Discreteness in Diffusion LLMs2025.12ArxivSpeed Analysis
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs2025.10ICLR
Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration2026.03ACLSelf-evaluation, Generalization analysis
On the Role of Discreteness in Diffusion LLMs2025.12ArxivDiscreteness analysis
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs2025.10ICLRBenchmark
Diffusion Language Models are Super Data Learners2025.11ArxivData learner analysis
Adaptation to Intrinsic Dependence in Diffusion Language Models2026.02ArxivDistribution-agnostic schedule theory
Confidence-Based Decoding is Provably Efficient for Diffusion Language Models2026.03ArxivFirst theory of confidence-based decoding
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?2026.02ArxivAR-like decoding analysis, NAP approach
Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects2026.03ArxivMemorization, privacy analysis
Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMs2026.03ArxivLayer skipping, representation analysis
Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison2026.03ArxivControlled AR vs MDM empirical study
Why Gaussian Diffusion Models Fail on Discrete Data?2026.04ArxivMultimodal sampling interval theory
Generative Frontiers: Why Evaluation Matters for Diffusion Language Models2026.04ArxivEvaluation methodology critique
Lost in Diffusion: Uncovering Hallucination Patterns and Failure Modes in Diffusion Large Language Models2026.04ACL FindingsHallucination patterns analysis
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models2026.04ICMLProximity bias analysis
Measuring Temporal Linguistic Emergence in Diffusion Language Models2026.04ArxivTemporal probing, linguistic emergence
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data2026.04ArxivAssociative memory theory
Understanding and Accelerating the Training of Masked Diffusion Language Models2026.05ArxivBell-shaped time sampling, training speed
Uncertainty Quantification for Large Language Diffusion Models2026.05ArxivUQ, hallucination detection for dLLMs
Continuous Language Diffusion as a Decoder-Interface Problem2026.06Arxiv-
Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens2026.06ArxivMoE
Diffusion Language Models: An Experimental Analysis2026.06ArxivUnmasking order
Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs2026.06ArxivUnmasking order
When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs2026.06ArxivCalibrating LoRA Monitors for Masked Diffusion
Understanding Evaluation Illusion in Diffusion Large Language Models2026.06Arxiv-
CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models2026.06ArxivRemasking, Unmasking order
Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization2026.07FRUCTStaged codec-vs-generation bottleneck diagnosis; project
Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs2026.07ArxivA One-Dimensional Self-Conditioning Attractor in Continuous
Subliminal Clocks: Latent Time Modelling in Diffusion Language Models2026.07ArxivLatent Time Modelling in Diffusion Language
Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting2026.07ArxivSpeculative decoding
Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models2026.07ArxivA Mechanistic Analysis of In-Context Learning
Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models2026.07ArxivSafety attack
Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models2026.07ArxivTraining-free, KV cache
Answer First, Reason Later: When Commitment Order Costs Accuracy in Diffusion Language Models2026.08ArxivWhen Commitment Order Costs Accuracy in
Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models2026.08ArxivWhy Predictive Feedback Fails in Diffusion
Scaling Inherently Interpretable Language Models2026.08Arxiv-
Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models2026.08ArxivUncovering the Representation-Confidence Gap in Diffusion
Minimax Optimality of Score-Entropy Discrete Diffusion2026.08Arxiv-
Conditional Total Correlation and the Serial Depth of Adaptive Parallel Sampling2026.08Arxiv-

8.2 Guidance & Downstream Applications

Paper TitleYearVenueRemark
DiffusEmp: A Diffusion Model-Based Framework with Multi-Grained Control for Empathetic Response Generation2023.06ACLDialogue
DiffuDetox: A Mixed Diffusion Model for Text Detoxification2023.06ACL FindingsDetoxification
PoetryDiffusion: Towards Joint Semantic and Metrical Manipulation in Poetry Generation2023.06AAAIPoetry Generation
ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style Transfer2023.08AAAIText Style Transfer
P^3SUM: Preserving Author's Perspective in News Summarization with Diffusion Language Models2023.11NAACLSummarization
DiffuCOMET: Contextual Commonsense Knowledge Diffusion2024.02ACLCommonsense
DiffusionDialog: A Diffusion Model for Diverse Dialog Generation with Latent Space2024.04LREC-COLINGDialogue
Diffusion Guided Language Modeling2024.08ACL FindingsControl
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models2024.11ACL FindingsData Synthesis
Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language Models2024.12ACLText Segmentation
EdiText: Controllable Coarse-to-Fine Text Editing with Diffusion Language Models2025.02ACLText Editing
Constrained Discrete Diffusion2025.03NeurIPSConstraint
Planning with Diffusion Models for Target-Oriented Dialogue Systems2025.04ACLDialogue
CtrlDiff: Boosting dLLMs with Dynamic Block Prediction2025.05ArxivControl
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective2025.05ArxivEmbedding
DINGO: Constrained Inference for Diffusion LLMs2025.05ArxivConstrained Decoding
Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design2025.05ICLRSMC test-time scaling
Mercury: Ultra-Fast Language Models Based on Diffusion2025.06ArxivCode
DiffuCoder: Improving Masked Diffusion for Code Generation2025.06ArxivCode
Unveiling the Potential of Diffusion Large Language Model in Controllable Generation2025.07ArxivControl
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement2025.07ArxivSummarization
Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling2025.08ArxivText Style Transfer
Seed Diffusion: Large-Scale dLLM with High-Speed Inference2025.08ArxivCode
TreeDiff: AST-Guided Code Generation with Diffusion LLMs2025.08ArxivCode (syntax-aware)
Beyond Autoregression: Empirical Study for Code Generation2025.09ArxivCode
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models2025.09ArxivControl
Syntax-Guided Diffusion Language Models with User-Integrated Personalization2025.10ArxivPersonalization
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models2025.10ArxivHallucination
Don't Let It Fade: Preserving Edits via Token Timestep Allocation2025.10NeurIPSControl
Diffusion Language Models for Speech Recognition2026.04ArxivASR rescoring (MDLM/USDM)
CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation2026.04ArxivMolecular generation
TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion2026.02ArxivTabular generation, masked diffusion
Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models2026.03ArxivRAG, retrieval-prior conflict handling
DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning2026.03EMNLP FindingsHallucination detection
Unlocking Prompt Infilling Capability for Diffusion Language Models2026.04ArxivPrompt infilling via full-sequence masking
DiffuMask: Diffusion Language Model for Token-level Prompt Pruning2026.04ArxivPrompt compression
BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning2026.04ArxivMolecule generation + captioning
HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models2026.04ArxivHallucination detection, denoising dynamics
Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks2026.05ArxivWatermark attack, security
DiffRetriever: Parallel Representative Tokens for Retrieval with Diffusion Language Models2026.05ArxivDense retrieval with dLLMs
Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models2026.05ArxivDynamic CFG via RL
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models2026.05ArxivAdaptive guidance schedule, SAE analysis
Constrained Code Generation with Discrete Diffusion2026.05ArxivNeurosymbolic constrained code generation
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA2026.05ArxivPrompt compression study
Machine Unlearning for Masked Diffusion Language Models2026.05ArxivMDU, unlearning framework
Knowledge Editing in Masked Diffusion Language Models2026.06ArxivUnmasking order, Knowledge editing
MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models2026.06ArxivSafety attack
Global Sketch-Based Watermarking for Diffusion Language Models2026.06ArxivWatermarking
Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models2026.06ACLTraining-free
Self-Augmenting Retrieval for Diffusion Language Models2026.06ICMLTraining-free, Serving
TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering2026.06ArxivAutomatic In-place Text Sequence Modification via
Detect, Remask, Repair: Diffusion Editing for Faithful Summarization of Evolving Contexts2026.06ArxivFew-step, Remasking
TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models2026.06ArxivMoE, Training-free
Self-Generated Error Training for Token Editing in Diffusion Language Models2026.06Arxiv-
TAG-DLM: Diffusion Language Models for Text-Attributed Graph Learning2026.06ArxivDiffusion Language Models for Text-Attributed Graph
TRE: Training-Free Hallucination Detection for Diffusion Language Models2026.06ArxivTraining-free, Hallucination
Diffusion-GR2: Diffusion Generative Reasoning Re-ranker2026.07ArxivDistillation, Serving
Discrete Diffusion Language Models for Interactive Radiology Report Drafting2026.07ArxivMoE, Clinical
Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata2026.07ArxivRemasking, Block diffusion
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model2026.07ArxivMoE
Diffusion Language Model for Recommendation2026.07Arxiv-
Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance2026.07ArxivTraining-free
DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models2026.07ArxivHallucination
EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning2026.08ArxivRemasking, dMLLM
Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion2026.08ArxivCharacter-Level Masked Diffusion for Ancient Greek
Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits2026.08ArxivSafety attack
Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models2026.08ArxivWhen Classifier-Free Guidance Becomes Unnecessary in
Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression2026.08ArxivServing, Compression
Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo2026.08Arxiv-
SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel Fields2026.08EMNLP FindingsWatermarking, Unmasking order
Length-Adaptive Decoding for Masked Diffusion Machine Translation2026.08EMNLPTraining-free, Unmasking order
DRRG: A Discrete Diffusion Framework for Radiology Report Generation2026.08ArxivClinical

9. Seminal Diffusion Papers


🤝 Contact

diffusion
diffusion-language-models
diffusion-model
diffusion-models
large-language-model
large-language-models

Contributors

KIM-JAKE

83 commits

Darklightened

22 commits

celve

2 commits

xiazhi1

2 commits