John-Ge/Awesome-Native-Multimodal-Models

36

14 commits

updated Apr 9, 2025

See the code

README

Native Multimodal Models for Vision Language Understanding and Generation

GitHub stars

Introduction

The unification of different deep learning architectures and tasks has reshaped various fields. The standardization of natural language processing via Large Language Models have revenlotionized NLP. This progress raises a critical question: Can we seamlessly integrate vision and language understanding with generation? Emerging native multimodal models like Gemini and GPT-4o demonstrate early successes in bridging these capabilities. While architectures for LLMs and vision-language models (e.g., LLaVA, Qwen-VL) show signs of convergence, vision generation remains fragmented across three paradigms: discrete autoregressive models, continuous diffusion models, and flow matching. This divergence highlights fundamental challenges in unifying multimodal understanding and generation. We systematically analyze existing approaches to identify optimal pathways for building truly unified multimodal architectures. We categoried these unified models into three approaches via the visual generation method: visual generation through external generator, discrete and continuous modeling.

Tree Plot

Taxonomy of Unified Models

Benchmark Results

Understanding

ModelParamsPOPEMME-PMMB_devSEEDVQAv2GQAMMMUMM-VetTextVQAMMStar
LWM75.2---55.844.826.39.618.8-
Unified-IO26.8B--71.5---86.2--61.8
LaVIT7B----66.046.8----
Emu13B----52.0-----
Emu237B-134563.6-84.965.134.148.566.6-
Emu38B85.21243.858.568.275.160.331.6-64.7-
SEEDLLaMA-I8B--45.851.566.2----31.7
SEED-X17B84.11457.070.166.571.249.135.643.0XXXXX-
Janus1.3B87.01338.069.463.777.359.130.534.3--
JanusFlow1.3B88.01333.174.970.579.860.329.330.9--
Janus-Pro1.5B86.21444.075.568.3-59.336.339.8--
Janus-Pro7B87.41567.179.272.1-62.041.050.0--
NExT-GPT13B----66.7-----
MUSE-VL7B-1480.972.170.0--42.3--48.3
MUSE-VL32B-1581.681.871.0--50.1--56.7
Libra11.3B88.21494.765.262.777.363.8-31.8--
TokenFLow-XL14B87.8-76.872.677.662.543.2-62.3-
QLIP7B86.11498.3--78.361.8-33.355.2-
UniTok7B83.21448--76.861.1-33.951.6-
DualToken3B86.01489.270.970.277.8-38.632.5--
Liquid7B81.11119.3--71.358.4--42.4-
SynerGen-VL2.4B85.3183753.762.0-59.734.234.567.5-
AnyGPT7B--------XXXXX-
MIO-Instruct7B---54.465.5---XXXXX-
ILLUME7B88.51445.375.172.966.2-38.237.072.131.7
VL-GPT7B----67.251.5--XXXXX-
MM-Interleaved13B----80.260.5--61.0-
Gemini-Nano-11.8B----62.7-26.3---
EasyGen7B-----44.6--XXXXX-
DreamLLM7B--58.2-72.9--36.6--
DEEM-VQA7B--60.8-68.255.7-37.4XXXXX-
X-VILA7B----72.9-33.9-XXXXX-
MetaMorph8B--75.271.8--41.8-60.544.0
VILA-U7B85.81401.8-59.079.460.8-33.5--
Chameleon7B-170.031.130.6--25.48.3-31.1
Chameleon30B-575.332.548.5--38.8--31.8
Video-LaVIT7B-1551.867.364.0------
Show-o1.3B84.51232.9--74.761.027.4---
HermesFlow1.3B81.41249.7--75.361.728.3---
Orthus7B79.61265.8--63.252.828.2---
Liquid†7B81.11119.3--71.3*58.4*--42.4-
D-DiT2B84.01124.7--60.159.2----
MMAR7B83.01393.966.3264.5---27.8--
LLaMAFusion8B-1603.7----41.7---
OmniMamba1.3B86.31290.6--77.760.830.6---
ILLUME+3B87.61414.080.873.3--44.340.369.9-
MetaQuery-XL7B-1685.283.576.9--58.666.6--
VARGPT7B87.31488.867.667.978.462.336.4-54.1-
VARGPT-v1.17B89.11684.181.0176.080.466.248.5-82.0-
UniToken7B--71.169.9--32.8--46.1

MJHQ-30K

MethodResolutionParams#ImagesFID
Generation Only
SD-XL-2000M9.55
PixArt-25M6.14
Playground v2.5--4.48
Unified Model
LWM7B-17.77
Show-o1.3B36M15.18
JanusFlow1.3B-9.51
MUSE-VL2567B30K7.73
Janus1.3B-10.10
VILA-U2567B15M12.81
VILA-U3847B15M7.69
SynerGen-VL2.4B30K6.10
Liquid5127B30M5.47
ILLUME7B30K7.76
ILLUME+3B30K6.00
MetaQuery-XL7B30K6.02

GenEval Bench

ModelParamsRes.Single Obj.Two Obj.Count.ColorsPositionColor Attri.Overall↑
Generation Model
LlamaGen0.8B-0.710.340.210.580.070.040.32
LDM1.4B-0.920.290.230.700.020.050.37
PixArt-α0.6B-0.980.500.440.800.080.070.48
VAR-256------0.53
Emu3-Gen8B-0.980.710.340.810.170.210.54
SDv1.50.9B-0.970.380.350.760.040.060.43
SDv2.10.9B-0.980.510.440.850.070.170.50
SDXL2.6B-0.980.740.390.850.150.230.55
SD32B-0.980.740.630.670.340.360.62
IF-XL4.3B-0.970.740.660.810.130.350.61
DALL-E 26.5B-0.940.660.490.770.100.190.52
DALL-E 3--0.960.870.470.830.430.450.67
Unified Model
CODI--0.890.160.160.650.020.010.31
BSQViT--------0.31
Chameleon34B-------0.39
LWM7B-0.930.410.460.790.090.150.47
QLIP7B-------0.48
SEED-X17B-0.970.580.260.800.190.140.49
MUSE-VL7B256------0.53
TokenFLow13B256------0.55
Orthus7B5120.990.750.260.840.280.380.58
SynerGen-VL2.4B-0.990.710.340.870.370.370.61
ILLUME7B-0.990.860.450.710.390.280.61
ILLUME+3B-0.990.880.620.840.420.530.72
Emu3-Gen8B-0.980.710.340.870.370.370.61
Transfusion-256------0.63
D-DiT2B-0.970.800.540.760.320.500.65
Show-o1.3B-0.980.800.660.840.310.500.68
HermesFlow1.3B-0.980.840.660.820.320.520.69
Janus1.3B-0.970.680.300.840.460.420.61
JanusFlow1.3B-0.970.590.450.830.530.420.63
Janus-Pro1.5B-0.980.820.510.890.650.560.73
Janus-Pro7B-0.990.890.590.900.790.660.80
MetaQuery-XL7B-------0.80
VARGPT-v1.17B-0.960.530.480.830.130.210.53
UniToken7B-0.990.800.350.840.380.390.63

Image Tokenizer

Discrete Encoder/VQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
17/11VQ-VAENeural Discrete Representation LearningarXiv
19/06VQ-VAE-2Generating Diverse High-Fidelity Images with VQ-VAE-2arXiv
20/12VQGANTaming Transformers for High-Resolution Image SynthesisarXivGitHub
21/10ViT-VQGANVECTOR-QUANTIZED IMAGE MODELING WITH IMPROVED VQGANarXiv
22/02MaskGITMaskGIT: Masked Generative Image TransformerarXiv
22/09MoVQMoVQ: Modulating Quantized Vectors for High-Fidelity Image GenerationarXiv
22/12MAGVITMAGVIT: Masked Generative Video TransformerarXivGitHub
23/10Efficient-VQGANEfficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision TransformersarXiv
24/03UniCodeUniCode: Learning a Unified Codebook for Multimodal Large Language ModelsarXiv
24/05ChameleonChameleon: Mixed-Modal Early-Fusion Foundation ModelsarXivGitHub
24/05LG-VQLG-VQ: Language-Guided Codebook LearningarXiv
24/06LlamaGENAutoregressive Model Beats Diffusion: Llama for Scalable Image GenerationarXivGitHub
24/06TiTokAn Image is Worth 32 Tokens for Reconstruction and GenerationarXivGitHub
24/06OmniTokenizer-VQVAEOmniTokenizer: A Joint Image-Video Tokenizer for Visual GenerationarXivGitHub
24/06VQGAN-LCScaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%arXiv
24/09MaskBitMaskBit: Embedding-free Image Generation via Bit TokensarXivGitHub
24/10BPE-VQFrom Pixels to Tokens: Byte-Pair Encoding on Quantized Visual ModalitiesarXiv
24/10RotationTrickRESTRUCTURING VECTOR QUANTIZATION WITH THE ROTATION TRICKarXivGitHub
24/10DiGITStabilize the Latent Space for Image Autoregressive Modeling: A Unified PerspectivearXivGitHub
24/11SimVQADDRESSING REPRESENTATION COLLAPSE IN VECTOR QUANTIZED MODELS WITH ONE LINEAR LAYERarXivGitHub
24/11ALITADAPTIVE LENGTH IMAGE TOKENIZATION VIA RECURRENT ALLOCATIONarXivGitHub
24/11VQ-KDImage Understanding Makes for A Good Tokenizer for Image GenerationarXivGitHub
24/11FQGANFactorized Visual Tokenization and GenerationarXivGitHub
24/12TokenFlowTokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationarXivGitHub
24/12SynerGen-VLSynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingarXiv
24/12SoftVQ-VAESoftVQ-VAE: Efficient 1-Dimensional Continuous TokenizerarXivGitHub
24/12CRTWhen Worse is Better: Navigating the compression-generation tradeoff in visual tokenizationarXiv
24/12IBQScalable Image Tokenization with Index Backpropagation QuantizationarXivGitHub
25/01TA-TiTokDemocratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional TokensarXivGitHub
25/01One-D-PieceOne-D-Piece: Image Tokenizer Meets Quality-Controllable CompressionarXivGitHub
25/02UniTokUniTok: A Unified Tokenizer for Visual Generation and UnderstandingarXivGitHub
25/03SemHiTokSemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and GenerationarXiv
25/03V2FlowV2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image GenerationarXivGitHub
25/03Robust TokenizerRobust Latent Matters: Boosting Image Generation with Sampling ErrorarXivGitHub
25/03PCA Tokenizer“Principal Components” Enable A New Language of ImagesarXivGitHub
25/03DualTokenDualToken: Towards Unifying Visual Understanding and Generation with Dual Visual VocabulariesarXivGitHub
25/03CTFImproving Autoregressive Image Generation through Coarse-to-Fine Token PredictionarXivGitHub
25/03TokenSetTokenize Image as a SetarXivGitHub
25/03TokenBridgeBridging Continuous and Discrete Tokens for Autoregressive Visual GenerationarXivProject Page

Discrete Encoder/RQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
22/03RQ-VAEAutoregressive Image Generation using Residual QuantizationarXivGitHub
24/04VARVisual Autoregressive Modeling: Scalable Image Generation via Next-Scale PredictionarXivGitHub
25/03NFIGNFIG: Autoregressive Image Generation with Next-Frequency PredictionarXiv

Discrete Encoder/FSQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/09FSQ-VQ-VAEFINITE SCALAR QUANTIZATION: VQ-VAE MADE SIMPLEarXivGitHub
24/10ElasticTokELASTICTOK: ADAPTIVE TOKENIZATION FOR IMAGE AND VIDEOarXivGitHub
24/12VIDTOKVIDTOK: A VERSATILE AND OPEN-SOURCE VIDEO TOKENIZERarXivGitHub
25/02FlexTokFlexTok: Resampling Images into 1D Token Sequences of Flexible LengtharXiv

Discrete Encoder/LFQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/10MAGVIT-v2Language Model Beats Diffusion -- Tokenizer is Key to Visual GenerationarXiv
24/05LIBRALibra: Building Decoupled Vision System on Large Language ModelsarXivGitHub
24/09Open-MAGVIT2Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual GenerationarXivGitHub
25/03FlowMoFlow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image TokenizationarXivProject Page

Discrete Encoder/BSQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/06BSQ-ViTImage and Video Tokenization with Binary Spherical QuantizationarXivGitHub
25/02QLIPQLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and GenerationarXivGitHub

Discrete Encoder/PQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/10ImageFolderImageFolder: Autoregressive Image Generation with Folded TokensarXivGitHub
24/12XQ-GANXQ-GAN: An Open-source Image Tokenization Framework for Autoregressive GenerationarXivGitHub

Discrete Encoder/Other Methods

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/12GSQScaling Image Tokenizers with Grouped Spherical QuantizationarXivGitHub
24/12TexTokLanguage-Guided Image Tokenization for GenerationarXivGitHub
24/12SITSpectral Image TokenizerarXiv

Continuous Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
13/12VAEAuto-Encoding Variational BayesarXiv
24/12DivotDivot: Diffusion Powers Video Tokenizer for Comprehension and GenerationarXivGitHub
25/01VA-VAEReconstruction vs. Generation:Taming Optimization Dilemma in Latent Diffusion ModelsarXivGitHub
25/01CATCAT: Content-Adaptive Image TokenizationarXiv
25/01ViTokLearnings from Scaling Visual Tokenizers for Reconstruction and GenerationarXivProject Page
25/02ReaLSExploring Representation-Aligned Latent Space for Better GenerationarXivGitHub
25/02MAETokMasked Autoencoders Are Effective Tokenizers for Diffusion ModelsarXivGitHub
25/02EQ-VAEEQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image ModelingarXivGitHub
25/03FARFrequency Autoregressive Image Generation with Continuous TokensarXivGitHub
25/03USPUSP: Unified Self-Supervised Pretraining for Image Generation and UnderstandingarXivGitHub
25/03TokenBridgeBridging Continuous and Discrete Tokens for Autoregressive Visual GenerationarXivProject Page

Text-Representation Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/02LQAELanguage Quantized AutoEncoders: Towards Unsupervised Text-Image AlignmentarXiv
23/06SPAESPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMsarXiv
24/03V2L-TokenizerBeyond Text: Frozen Large Language Models in Visual Signal ComprehensionarXivGitHub
24/12ViLexVisual Lexicon: Rich Image Features in Language SpacearXiv

External Image Generator

Discrete Condition

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/09LAViTUnified Language-Vision Pretraining in Llm With Dynamic Discrete Visual TokenizationarXivGitHub
23/10SEEDMaking Llama See and Draw With Seed TokenizerarXivGitHub
24/02AnyGPTAnygpt: Unified Multimodal Llm With Discrete Sequence ModelingarXivGitHub
24/09MIOMio: A Foundation Model on Multimodal TokensarXivGitHub
24/12IllumeIllume: Illuminating Your Llms to See, Draw, and Self-EnhancearXivGitHub
25/04ILLUME+ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion RefinementarXivGitHub

Continuous Condition

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/07EmuEmu: Generative Pretraining in MultimodalityarXivGitHub
23/09NExT-GPTNext-GptarXivGitHub
23/10MiniGPT-5Minigpt-5: Interleaved Vision-and-Language Generation Via Generative VokensarXiv
23/12VL-GPTVl-Gpt: A Generative Pre-Trained Transformer for Vision and Language Understanding and GenerationarXivGitHub
23/12Emu2Generative Multimodal Models Are In-Context LearnersarXivGitHub
24/01MM-InterleavedMm-Interleaved: Interleaved Image-Text Generative Modeling Via Multi-Modal Feature SynchronizerarXivGitHub
23/10EasyGenEasygen: Easing Multimodal Generation With Bidiffuser and LlmsarXiv
23/11CoDi-2Codi-2: In-Context Interleaved and Interactive Any-to-Any GenerationarXiv
24/04SEED-XSeed-X: Multimodal Models With Unified Multi-Granularity Comprehension and GenerationarXivGitHub
23/09DreamLLMDreamllm: Synergistic Multimodal Comprehension and CreationarXivGitHub
24/05DEEMDeem: Diffusion Models Serve as the Eyes of Large Language Models for Image PerceptionarXivGitHub
24/05X-VILAX-Vila: Cross-Modality Alignment for Large Language ModelarXiv
24/11SpiderSpider: Any-to-Many Multimodal LlmarXiv
24/12MetaMorphMetamorph: Multimodal Understanding and Generation Via Instruction TuningarXivProject Page
25/04MetaQueryTransfer between Modalities with MetaQueriesarXivProject Page

Discrete Image Modelling

VQGAN Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
22/02OFAOfa: Unifying Multimodal Pretrained ModelsarXivGitHub
22/06Unified-IOUnified-Io: A Unified Model for Vision, Language, and Multi-Modal TasksarXivGitHub
23/11TealTeal: Tokenize and Embed All for Multi-Modal Large Language ModelsarXiv
24/02LWMWorld Model on Million-Length Video and Language With RingattentionarXivGitHub
24/05ChameleonChameleon: Mixed-Modal Early-Fusion Foundation ModelsarXivGitHub
24/06LlamaGENAutoregressive Model Beats Diffusion: Llama for Scalable Image GenerationarXivGitHub
24/064M-214M-21: An Any-to-Any Vision Model for Tens of Tasks and ModalitiesarXiv
24/07ANOLEAnole: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text GenerationarXivGitHub
24/08Show-oShow-o: One single transformer to unify multimodal understanding and generationarXiv
24/09Emu3Emu3: Next-Token Prediction is All You NeedarXiv
24/12LiquidLiquid: Language Models are Scalable Multi-modal GeneratorsarXiv
24/12SynerGen-VLSynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingarXiv
25/02HermesFlowHermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and GenerationarXivGitHub

Semantic Encoders

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/05LIBRALibra: Building Decoupled Vision System on Large Language ModelsarXivGitHub
24/06SeTokTowards Semantic Equivalence of Tokenization in Multimodal LLMarXivGitHub
24/09VILA-UVILA-U: a Unified Foundation Model Integrating Visual Understanding and GenerationarXivGitHub
24/11MUSE-VLMUSE-VL: Modeling Unified VLM through Semantic Discrete EncodingarXiv
24/12TokenFlowTokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationarXivGitHub
25/02QLIPQLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and GenerationarXivGitHub
25/02UniTokUniTok: A Unified Tokenizer for Visual Generation and UnderstandingarXivGitHub
25/03DualTokenDualToken: Towards Unifying Visual Understanding and Generation with Dual Visual VocabulariesarXivGitHub

Decoupled Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/12Unified-IO 2Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and ActionarXivGitHub
24/05Morph-TokensAuto-Encoding Morph-Tokens for Multimodal LLMarXivGitHub
24/10JanusJanus: Decoupling Visual Encoding for Unified Multimodal Understanding and GenerationarxivGitHub
24/12ILLUMEILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhancearxiv
25/01VARGPTVARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language ModelarxivGitHub
25/01Janus-ProJanus-Pro: Unified Multimodal Understanding and Generation with Data and Model ScalingarxivGitHub
25/03OmniMambaOmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space ModelsarxivGitHub
25/04VARGPT-v1.1VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement LearningarxivGitHub
25/04UniTokenUniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual EncodingarxivGitHub

Continuous Image Modelling

Diffusion

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/08TransfusionTransfusion: Predict The Next Token and Diffuse Images With One Multi-Modal ModelarXiv
24/09MonoFormerMonoFormer: One transformer for both diffusion and autoregressionarXivGitHub
24/11JanusFlowJanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and GenerationarXivGitHub
24/11JetFormerJetFormer: An Autoregressive Generative Model of Raw Images and TextarXiv
24/12CausalFusionCausal Diffusion Transformers for Generative ModelingarXivGitHub
24/12LLaMAFusionLlamaFusion: Adapting Pretrained Language Models for Multimodal GenerationarXiv

AR+Diffusion

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/10MMARTowards Lossless Multi-Modal Auto-Regressive Prababilistic ModelingarXivGitHub
24/12OrthusOrthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific HeadsarXiv
24/12LatentLMMultimodal Latent Language Modeling with Next-Token DiffusionarxivGitHub
25/03UniFluidUnified Autoregressive Visual Generation and Understanding with Continuous Tokensarxiv

Diffusion Models

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/03UniDiffuserOne Transformer Fits All Distributions in Multi-Modal Diffusion at ScalearXivGitHub
23/05CoDiAny-to-Any Generation via Composable DiffusionarXivProject Page
23/06UniDiffUniDiff: Advancing Vision-Language Models with Generative and Discriminative LearningarXiv
24/12OmniFlowOmniFlow: Any-to-Any Generation with Multi-Modal Rectified FlowsarXivGitHub
25/01D-DiTDual Diffusion for Unified Image Generation and UnderstandingarXivGitHub
25/03X2IX2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention DistillationarXivGitHub

Contributors

John-Ge

7 commits

Mingyang-Han

7 commits

John-Ge/Awesome-Native-Multimodal-Models

36

14 commits

updated Apr 9, 2025

See the code

README

Native Multimodal Models for Vision Language Understanding and Generation

GitHub stars

Introduction

The unification of different deep learning architectures and tasks has reshaped various fields. The standardization of natural language processing via Large Language Models have revenlotionized NLP. This progress raises a critical question: Can we seamlessly integrate vision and language understanding with generation? Emerging native multimodal models like Gemini and GPT-4o demonstrate early successes in bridging these capabilities. While architectures for LLMs and vision-language models (e.g., LLaVA, Qwen-VL) show signs of convergence, vision generation remains fragmented across three paradigms: discrete autoregressive models, continuous diffusion models, and flow matching. This divergence highlights fundamental challenges in unifying multimodal understanding and generation. We systematically analyze existing approaches to identify optimal pathways for building truly unified multimodal architectures. We categoried these unified models into three approaches via the visual generation method: visual generation through external generator, discrete and continuous modeling.

Tree Plot

Taxonomy of Unified Models

Benchmark Results

Understanding

ModelParamsPOPEMME-PMMB_devSEEDVQAv2GQAMMMUMM-VetTextVQAMMStar
LWM75.2---55.844.826.39.618.8-
Unified-IO26.8B--71.5---86.2--61.8
LaVIT7B----66.046.8----
Emu13B----52.0-----
Emu237B-134563.6-84.965.134.148.566.6-
Emu38B85.21243.858.568.275.160.331.6-64.7-
SEEDLLaMA-I8B--45.851.566.2----31.7
SEED-X17B84.11457.070.166.571.249.135.643.0XXXXX-
Janus1.3B87.01338.069.463.777.359.130.534.3--
JanusFlow1.3B88.01333.174.970.579.860.329.330.9--
Janus-Pro1.5B86.21444.075.568.3-59.336.339.8--
Janus-Pro7B87.41567.179.272.1-62.041.050.0--
NExT-GPT13B----66.7-----
MUSE-VL7B-1480.972.170.0--42.3--48.3
MUSE-VL32B-1581.681.871.0--50.1--56.7
Libra11.3B88.21494.765.262.777.363.8-31.8--
TokenFLow-XL14B87.8-76.872.677.662.543.2-62.3-
QLIP7B86.11498.3--78.361.8-33.355.2-
UniTok7B83.21448--76.861.1-33.951.6-
DualToken3B86.01489.270.970.277.8-38.632.5--
Liquid7B81.11119.3--71.358.4--42.4-
SynerGen-VL2.4B85.3183753.762.0-59.734.234.567.5-
AnyGPT7B--------XXXXX-
MIO-Instruct7B---54.465.5---XXXXX-
ILLUME7B88.51445.375.172.966.2-38.237.072.131.7
VL-GPT7B----67.251.5--XXXXX-
MM-Interleaved13B----80.260.5--61.0-
Gemini-Nano-11.8B----62.7-26.3---
EasyGen7B-----44.6--XXXXX-
DreamLLM7B--58.2-72.9--36.6--
DEEM-VQA7B--60.8-68.255.7-37.4XXXXX-
X-VILA7B----72.9-33.9-XXXXX-
MetaMorph8B--75.271.8--41.8-60.544.0
VILA-U7B85.81401.8-59.079.460.8-33.5--
Chameleon7B-170.031.130.6--25.48.3-31.1
Chameleon30B-575.332.548.5--38.8--31.8
Video-LaVIT7B-1551.867.364.0------
Show-o1.3B84.51232.9--74.761.027.4---
HermesFlow1.3B81.41249.7--75.361.728.3---
Orthus7B79.61265.8--63.252.828.2---
Liquid†7B81.11119.3--71.3*58.4*--42.4-
D-DiT2B84.01124.7--60.159.2----
MMAR7B83.01393.966.3264.5---27.8--
LLaMAFusion8B-1603.7----41.7---
OmniMamba1.3B86.31290.6--77.760.830.6---
ILLUME+3B87.61414.080.873.3--44.340.369.9-
MetaQuery-XL7B-1685.283.576.9--58.666.6--
VARGPT7B87.31488.867.667.978.462.336.4-54.1-
VARGPT-v1.17B89.11684.181.0176.080.466.248.5-82.0-
UniToken7B--71.169.9--32.8--46.1

MJHQ-30K

MethodResolutionParams#ImagesFID
Generation Only
SD-XL-2000M9.55
PixArt-25M6.14
Playground v2.5--4.48
Unified Model
LWM7B-17.77
Show-o1.3B36M15.18
JanusFlow1.3B-9.51
MUSE-VL2567B30K7.73
Janus1.3B-10.10
VILA-U2567B15M12.81
VILA-U3847B15M7.69
SynerGen-VL2.4B30K6.10
Liquid5127B30M5.47
ILLUME7B30K7.76
ILLUME+3B30K6.00
MetaQuery-XL7B30K6.02

GenEval Bench

ModelParamsRes.Single Obj.Two Obj.Count.ColorsPositionColor Attri.Overall↑
Generation Model
LlamaGen0.8B-0.710.340.210.580.070.040.32
LDM1.4B-0.920.290.230.700.020.050.37
PixArt-α0.6B-0.980.500.440.800.080.070.48
VAR-256------0.53
Emu3-Gen8B-0.980.710.340.810.170.210.54
SDv1.50.9B-0.970.380.350.760.040.060.43
SDv2.10.9B-0.980.510.440.850.070.170.50
SDXL2.6B-0.980.740.390.850.150.230.55
SD32B-0.980.740.630.670.340.360.62
IF-XL4.3B-0.970.740.660.810.130.350.61
DALL-E 26.5B-0.940.660.490.770.100.190.52
DALL-E 3--0.960.870.470.830.430.450.67
Unified Model
CODI--0.890.160.160.650.020.010.31
BSQViT--------0.31
Chameleon34B-------0.39
LWM7B-0.930.410.460.790.090.150.47
QLIP7B-------0.48
SEED-X17B-0.970.580.260.800.190.140.49
MUSE-VL7B256------0.53
TokenFLow13B256------0.55
Orthus7B5120.990.750.260.840.280.380.58
SynerGen-VL2.4B-0.990.710.340.870.370.370.61
ILLUME7B-0.990.860.450.710.390.280.61
ILLUME+3B-0.990.880.620.840.420.530.72
Emu3-Gen8B-0.980.710.340.870.370.370.61
Transfusion-256------0.63
D-DiT2B-0.970.800.540.760.320.500.65
Show-o1.3B-0.980.800.660.840.310.500.68
HermesFlow1.3B-0.980.840.660.820.320.520.69
Janus1.3B-0.970.680.300.840.460.420.61
JanusFlow1.3B-0.970.590.450.830.530.420.63
Janus-Pro1.5B-0.980.820.510.890.650.560.73
Janus-Pro7B-0.990.890.590.900.790.660.80
MetaQuery-XL7B-------0.80
VARGPT-v1.17B-0.960.530.480.830.130.210.53
UniToken7B-0.990.800.350.840.380.390.63

Image Tokenizer

Discrete Encoder/VQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
17/11VQ-VAENeural Discrete Representation LearningarXiv
19/06VQ-VAE-2Generating Diverse High-Fidelity Images with VQ-VAE-2arXiv
20/12VQGANTaming Transformers for High-Resolution Image SynthesisarXivGitHub
21/10ViT-VQGANVECTOR-QUANTIZED IMAGE MODELING WITH IMPROVED VQGANarXiv
22/02MaskGITMaskGIT: Masked Generative Image TransformerarXiv
22/09MoVQMoVQ: Modulating Quantized Vectors for High-Fidelity Image GenerationarXiv
22/12MAGVITMAGVIT: Masked Generative Video TransformerarXivGitHub
23/10Efficient-VQGANEfficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision TransformersarXiv
24/03UniCodeUniCode: Learning a Unified Codebook for Multimodal Large Language ModelsarXiv
24/05ChameleonChameleon: Mixed-Modal Early-Fusion Foundation ModelsarXivGitHub
24/05LG-VQLG-VQ: Language-Guided Codebook LearningarXiv
24/06LlamaGENAutoregressive Model Beats Diffusion: Llama for Scalable Image GenerationarXivGitHub
24/06TiTokAn Image is Worth 32 Tokens for Reconstruction and GenerationarXivGitHub
24/06OmniTokenizer-VQVAEOmniTokenizer: A Joint Image-Video Tokenizer for Visual GenerationarXivGitHub
24/06VQGAN-LCScaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%arXiv
24/09MaskBitMaskBit: Embedding-free Image Generation via Bit TokensarXivGitHub
24/10BPE-VQFrom Pixels to Tokens: Byte-Pair Encoding on Quantized Visual ModalitiesarXiv
24/10RotationTrickRESTRUCTURING VECTOR QUANTIZATION WITH THE ROTATION TRICKarXivGitHub
24/10DiGITStabilize the Latent Space for Image Autoregressive Modeling: A Unified PerspectivearXivGitHub
24/11SimVQADDRESSING REPRESENTATION COLLAPSE IN VECTOR QUANTIZED MODELS WITH ONE LINEAR LAYERarXivGitHub
24/11ALITADAPTIVE LENGTH IMAGE TOKENIZATION VIA RECURRENT ALLOCATIONarXivGitHub
24/11VQ-KDImage Understanding Makes for A Good Tokenizer for Image GenerationarXivGitHub
24/11FQGANFactorized Visual Tokenization and GenerationarXivGitHub
24/12TokenFlowTokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationarXivGitHub
24/12SynerGen-VLSynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingarXiv
24/12SoftVQ-VAESoftVQ-VAE: Efficient 1-Dimensional Continuous TokenizerarXivGitHub
24/12CRTWhen Worse is Better: Navigating the compression-generation tradeoff in visual tokenizationarXiv
24/12IBQScalable Image Tokenization with Index Backpropagation QuantizationarXivGitHub
25/01TA-TiTokDemocratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional TokensarXivGitHub
25/01One-D-PieceOne-D-Piece: Image Tokenizer Meets Quality-Controllable CompressionarXivGitHub
25/02UniTokUniTok: A Unified Tokenizer for Visual Generation and UnderstandingarXivGitHub
25/03SemHiTokSemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and GenerationarXiv
25/03V2FlowV2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image GenerationarXivGitHub
25/03Robust TokenizerRobust Latent Matters: Boosting Image Generation with Sampling ErrorarXivGitHub
25/03PCA Tokenizer“Principal Components” Enable A New Language of ImagesarXivGitHub
25/03DualTokenDualToken: Towards Unifying Visual Understanding and Generation with Dual Visual VocabulariesarXivGitHub
25/03CTFImproving Autoregressive Image Generation through Coarse-to-Fine Token PredictionarXivGitHub
25/03TokenSetTokenize Image as a SetarXivGitHub
25/03TokenBridgeBridging Continuous and Discrete Tokens for Autoregressive Visual GenerationarXivProject Page

Discrete Encoder/RQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
22/03RQ-VAEAutoregressive Image Generation using Residual QuantizationarXivGitHub
24/04VARVisual Autoregressive Modeling: Scalable Image Generation via Next-Scale PredictionarXivGitHub
25/03NFIGNFIG: Autoregressive Image Generation with Next-Frequency PredictionarXiv

Discrete Encoder/FSQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/09FSQ-VQ-VAEFINITE SCALAR QUANTIZATION: VQ-VAE MADE SIMPLEarXivGitHub
24/10ElasticTokELASTICTOK: ADAPTIVE TOKENIZATION FOR IMAGE AND VIDEOarXivGitHub
24/12VIDTOKVIDTOK: A VERSATILE AND OPEN-SOURCE VIDEO TOKENIZERarXivGitHub
25/02FlexTokFlexTok: Resampling Images into 1D Token Sequences of Flexible LengtharXiv

Discrete Encoder/LFQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/10MAGVIT-v2Language Model Beats Diffusion -- Tokenizer is Key to Visual GenerationarXiv
24/05LIBRALibra: Building Decoupled Vision System on Large Language ModelsarXivGitHub
24/09Open-MAGVIT2Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual GenerationarXivGitHub
25/03FlowMoFlow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image TokenizationarXivProject Page

Discrete Encoder/BSQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/06BSQ-ViTImage and Video Tokenization with Binary Spherical QuantizationarXivGitHub
25/02QLIPQLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and GenerationarXivGitHub

Discrete Encoder/PQ

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/10ImageFolderImageFolder: Autoregressive Image Generation with Folded TokensarXivGitHub
24/12XQ-GANXQ-GAN: An Open-source Image Tokenization Framework for Autoregressive GenerationarXivGitHub

Discrete Encoder/Other Methods

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/12GSQScaling Image Tokenizers with Grouped Spherical QuantizationarXivGitHub
24/12TexTokLanguage-Guided Image Tokenization for GenerationarXivGitHub
24/12SITSpectral Image TokenizerarXiv

Continuous Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
13/12VAEAuto-Encoding Variational BayesarXiv
24/12DivotDivot: Diffusion Powers Video Tokenizer for Comprehension and GenerationarXivGitHub
25/01VA-VAEReconstruction vs. Generation:Taming Optimization Dilemma in Latent Diffusion ModelsarXivGitHub
25/01CATCAT: Content-Adaptive Image TokenizationarXiv
25/01ViTokLearnings from Scaling Visual Tokenizers for Reconstruction and GenerationarXivProject Page
25/02ReaLSExploring Representation-Aligned Latent Space for Better GenerationarXivGitHub
25/02MAETokMasked Autoencoders Are Effective Tokenizers for Diffusion ModelsarXivGitHub
25/02EQ-VAEEQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image ModelingarXivGitHub
25/03FARFrequency Autoregressive Image Generation with Continuous TokensarXivGitHub
25/03USPUSP: Unified Self-Supervised Pretraining for Image Generation and UnderstandingarXivGitHub
25/03TokenBridgeBridging Continuous and Discrete Tokens for Autoregressive Visual GenerationarXivProject Page

Text-Representation Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/02LQAELanguage Quantized AutoEncoders: Towards Unsupervised Text-Image AlignmentarXiv
23/06SPAESPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMsarXiv
24/03V2L-TokenizerBeyond Text: Frozen Large Language Models in Visual Signal ComprehensionarXivGitHub
24/12ViLexVisual Lexicon: Rich Image Features in Language SpacearXiv

External Image Generator

Discrete Condition

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/09LAViTUnified Language-Vision Pretraining in Llm With Dynamic Discrete Visual TokenizationarXivGitHub
23/10SEEDMaking Llama See and Draw With Seed TokenizerarXivGitHub
24/02AnyGPTAnygpt: Unified Multimodal Llm With Discrete Sequence ModelingarXivGitHub
24/09MIOMio: A Foundation Model on Multimodal TokensarXivGitHub
24/12IllumeIllume: Illuminating Your Llms to See, Draw, and Self-EnhancearXivGitHub
25/04ILLUME+ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion RefinementarXivGitHub

Continuous Condition

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/07EmuEmu: Generative Pretraining in MultimodalityarXivGitHub
23/09NExT-GPTNext-GptarXivGitHub
23/10MiniGPT-5Minigpt-5: Interleaved Vision-and-Language Generation Via Generative VokensarXiv
23/12VL-GPTVl-Gpt: A Generative Pre-Trained Transformer for Vision and Language Understanding and GenerationarXivGitHub
23/12Emu2Generative Multimodal Models Are In-Context LearnersarXivGitHub
24/01MM-InterleavedMm-Interleaved: Interleaved Image-Text Generative Modeling Via Multi-Modal Feature SynchronizerarXivGitHub
23/10EasyGenEasygen: Easing Multimodal Generation With Bidiffuser and LlmsarXiv
23/11CoDi-2Codi-2: In-Context Interleaved and Interactive Any-to-Any GenerationarXiv
24/04SEED-XSeed-X: Multimodal Models With Unified Multi-Granularity Comprehension and GenerationarXivGitHub
23/09DreamLLMDreamllm: Synergistic Multimodal Comprehension and CreationarXivGitHub
24/05DEEMDeem: Diffusion Models Serve as the Eyes of Large Language Models for Image PerceptionarXivGitHub
24/05X-VILAX-Vila: Cross-Modality Alignment for Large Language ModelarXiv
24/11SpiderSpider: Any-to-Many Multimodal LlmarXiv
24/12MetaMorphMetamorph: Multimodal Understanding and Generation Via Instruction TuningarXivProject Page
25/04MetaQueryTransfer between Modalities with MetaQueriesarXivProject Page

Discrete Image Modelling

VQGAN Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
22/02OFAOfa: Unifying Multimodal Pretrained ModelsarXivGitHub
22/06Unified-IOUnified-Io: A Unified Model for Vision, Language, and Multi-Modal TasksarXivGitHub
23/11TealTeal: Tokenize and Embed All for Multi-Modal Large Language ModelsarXiv
24/02LWMWorld Model on Million-Length Video and Language With RingattentionarXivGitHub
24/05ChameleonChameleon: Mixed-Modal Early-Fusion Foundation ModelsarXivGitHub
24/06LlamaGENAutoregressive Model Beats Diffusion: Llama for Scalable Image GenerationarXivGitHub
24/064M-214M-21: An Any-to-Any Vision Model for Tens of Tasks and ModalitiesarXiv
24/07ANOLEAnole: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text GenerationarXivGitHub
24/08Show-oShow-o: One single transformer to unify multimodal understanding and generationarXiv
24/09Emu3Emu3: Next-Token Prediction is All You NeedarXiv
24/12LiquidLiquid: Language Models are Scalable Multi-modal GeneratorsarXiv
24/12SynerGen-VLSynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingarXiv
25/02HermesFlowHermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and GenerationarXivGitHub

Semantic Encoders

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/05LIBRALibra: Building Decoupled Vision System on Large Language ModelsarXivGitHub
24/06SeTokTowards Semantic Equivalence of Tokenization in Multimodal LLMarXivGitHub
24/09VILA-UVILA-U: a Unified Foundation Model Integrating Visual Understanding and GenerationarXivGitHub
24/11MUSE-VLMUSE-VL: Modeling Unified VLM through Semantic Discrete EncodingarXiv
24/12TokenFlowTokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationarXivGitHub
25/02QLIPQLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and GenerationarXivGitHub
25/02UniTokUniTok: A Unified Tokenizer for Visual Generation and UnderstandingarXivGitHub
25/03DualTokenDualToken: Towards Unifying Visual Understanding and Generation with Dual Visual VocabulariesarXivGitHub

Decoupled Encoder

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/12Unified-IO 2Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and ActionarXivGitHub
24/05Morph-TokensAuto-Encoding Morph-Tokens for Multimodal LLMarXivGitHub
24/10JanusJanus: Decoupling Visual Encoding for Unified Multimodal Understanding and GenerationarxivGitHub
24/12ILLUMEILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhancearxiv
25/01VARGPTVARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language ModelarxivGitHub
25/01Janus-ProJanus-Pro: Unified Multimodal Understanding and Generation with Data and Model ScalingarxivGitHub
25/03OmniMambaOmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space ModelsarxivGitHub
25/04VARGPT-v1.1VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement LearningarxivGitHub
25/04UniTokenUniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual EncodingarxivGitHub

Continuous Image Modelling

Diffusion

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/08TransfusionTransfusion: Predict The Next Token and Diffuse Images With One Multi-Modal ModelarXiv
24/09MonoFormerMonoFormer: One transformer for both diffusion and autoregressionarXivGitHub
24/11JanusFlowJanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and GenerationarXivGitHub
24/11JetFormerJetFormer: An Autoregressive Generative Model of Raw Images and TextarXiv
24/12CausalFusionCausal Diffusion Transformers for Generative ModelingarXivGitHub
24/12LLaMAFusionLlamaFusion: Adapting Pretrained Language Models for Multimodal GenerationarXiv

AR+Diffusion

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
24/10MMARTowards Lossless Multi-Modal Auto-Regressive Prababilistic ModelingarXivGitHub
24/12OrthusOrthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific HeadsarXiv
24/12LatentLMMultimodal Latent Language Modeling with Next-Token DiffusionarxivGitHub
25/03UniFluidUnified Autoregressive Visual Generation and Understanding with Continuous Tokensarxiv

Diffusion Models

Publication DateMethod AbbreviationFull TitlearXiv LinkCode Repository
23/03UniDiffuserOne Transformer Fits All Distributions in Multi-Modal Diffusion at ScalearXivGitHub
23/05CoDiAny-to-Any Generation via Composable DiffusionarXivProject Page
23/06UniDiffUniDiff: Advancing Vision-Language Models with Generative and Discriminative LearningarXiv
24/12OmniFlowOmniFlow: Any-to-Any Generation with Multi-Modal Rectified FlowsarXivGitHub
25/01D-DiTDual Diffusion for Unified Image Generation and UnderstandingarXivGitHub
25/03X2IX2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention DistillationarXivGitHub

Contributors

John-Ge

7 commits

Mingyang-Han

7 commits