threegold116/Awesome-Omni-MLLMs

This is for ACL 2025 Findings Paper: From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalitiesModels

104

81 commits

updated Mar 22, 2026

See the code

README

From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities

Shixin Jiang1∗, Jiafeng Liang1, Jiyuan Wang1, Xuan Dong1, Heng Chang3, Weijiang Yu3, Jinhua Du4, Ming Liu1†,2, Bing Qin1,2
1Harbin Institute of Technology, Harbin, China
2Peng Cheng Laboratory, Shenzhen, China
3Huawei Inc., Shenzhen, China
4Huawei London Research Centre, London, UK

This repository contains the resources for arxiv paper From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities

taxonomy

For more details, please refer to the paper: From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities.

📢 Updates

visitors

  • 2025/05/16 Our paper is accepted as ACL2025 Findings 🎉.
  • 2025/02/28 We have updated 23 papers in the reading list 📚.
  • 2025/02/20 We have updated 55 papers first in the reading list 📚.
  • 2025/02/15 The second version of our paper has been released, check it on arxiv 🎓.
  • 2024/12/16 The first version of our paper is available on arxiv 🎓.

This reading list will be updated periodically, and if you have any suggestions or find some we missed, feel free to contact us! You can submit an issue or send an email (sxjiang@ir.hit.edu.cn).

🗂️ Tables of Contents

🧠Awesome Omni-MLLMs

Omni-MLLM: The MLLMs which can handle more than 2 extra-linguistic modalities.

🌿Multi-branch Continuous Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star OmniGAIA: Towards Native Omni-Modal AI Agents
Arxiv2026-02-28GithubVisual/Audio/Text
➜Text
✅❌
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
Arxiv2026-02-28--Visual/Audio/Text
➜Text
✅❌
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
Arxiv2026-02-15--Visual/Audio/Text
➜Text
✅❌
Star Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
Arxiv2026-02-10GithubVisual/Audio/Text
➜Text
✅❌
Star ChronusOmni: Improving Time Awareness of Omni Large Language Models
Arxiv2025-12-10GithubVisual/Audio/Text
➜Text
✅❌
Star Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
Arxiv2025-12-03GithubVisual/Audio/Text
➜Text
✅❌
Star Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
Arxiv2025-11-16GithubVisual/Audio/Text
➜Text/Audio/Visual
✅✅
Star Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
Arxiv2025-11-10GithubVisual/Audio/Text
➜Text
✅❌
Star LongCat-Flash-Omni Technical Report
Arxiv2025-10-31GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
Arxiv2025-10-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
Arxiv2025-10-27GithubVisual/Audio/Text
➜Scalar
✅❌
Star RoboOmni: Proactive Robot Manipulation in Omni-modal Context
Arxiv2025-10-27GithubVisual/Audio/Text
➜Text/Audio/Action
✅✅
Star OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
Arxiv2025-10-17GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
Arxiv2025-10-15GithubVisual/Audio/Text
➜Text/Audio
✅✅
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
NIPS2025-10-05--Visual/Audio/Text
➜Text
✅❌
Star
Qwen3-Omni Technical Report
arXiv2025-09-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
Arxiv2025-08-20GithubVisual/Audio/Text
➜Text
✅❌
Star Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
Arxiv2025-08-06--Visual/Audio/Text
➜Text
✅❌
Star VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
Arxiv2025-08-04--Visual/Audio/Text
➜Text
✅✅
AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
Arxiv2025-08-04--Visual/Audio/Text
➜Text
✅❌
StarTowards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
ICCV2025-07-30--Visual/Audio/Text
➜Text
✅❌
StarARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
Arxiv2025-07-29--Visual/Audio/Text
➜Text
✅❌
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
Arxiv2025-07-15--Visual/Audio/Text
➜Text
✅✅
Star HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
Arxiv2025-06-26GithubVisual/Audio/Text
➜Text
✅❌
video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language Models
Arxiv2025-06-05--Visual/Audio/Text
➜Text
✅❌
Star AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
Arxiv2025-06-05GithubVisual/Audio/Text
➜Text
✅❌
Star Is Extending Modality The Right Path Towards Omni-Modality?
Arxiv2025-06-02GithubVisual/Audio/Text
➜Text
✅❌
Star Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Star Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Star Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
Arxiv2025-05-23--Visual/Audio/Text
➜Text
✅❌
Star Ming-Omni: A Unified Multimodal Model for Perception and Generation
Arxiv2025-05-07GithubVisual/Audio/Text
➜Text/Audio/Visual
✅✅
Star EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
Arxiv2025-05-07GithubVisual/Audio/Text
➜Text
✅❌
Star Multimodal Long Video Modeling Based on Temporal Dynamic Context
Arxiv2025-04-14GithubVisual/Audio/Text
➜Text
✅❌
Star Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
ICLR
Workshop
2025-04-10GithubVisual/Audio/Text
➜Text
✅❌
Star FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
Arxiv2025-04-01GithubVisual/Audio/Text
➜Text
✅❌
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
arXiv2025-03-31-Visual/Audio/Text
➜Text
✅❌
Star
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
CVPR2025-03-28GithubVisual/Audio/Text
➜Text
✅❌
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
arXiv2025-03-27-Visual/Audio/Text
➜Text/Audio
✅✅
Star
Qwen2.5-Omni Technical Report
arXiv2025-03-27GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Vision-Speech Models: Teaching Speech Models to Converse about Images
arXiv2025-03-20GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
ViSpeak: Visual Instruction Feedback in Streaming Videos
arXiv2025-03-17GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
CVPR2025-03-17GithubVisual/Audio/Text
➜Text
✅❌
Star
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
arXiv2025-03-14GithubVisual/Audio/Text
➜Text
✅❌
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
arXiv2025-03-11-Visual/3D/Text
➜Text
✅❌
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
arXiv2025-03-09-Visual/Audio/Text
➜Text
✅❌
Star
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcing Learning
arXiv2025-03-07GithubVisual/Audio/Text
➜Text
✅❌
Star
EgoLife: Towards Egocentric Life Assistant
CVPR2025-03-05GithubVisual/Audio/Text
➜Text
✅❌
Star
Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
arXiv2025-03-03GithubVisual/Audio/Text
➜Text
✅❌
Nexus-O: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
arXiv2025-02-26Visual/Audio/Text
➜Text/Audio
✅✅
Star
Megrez-Omni Technical Report
arXiv2025-02-19GithubVisual/Audio/Text
➜Text
✅❌
Star
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
ICML2025-02-17GithubVisual/Audio/Text
➜Text
✅❌
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
WWW2025-02-07-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance
arXiv2025-02-06-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Ola: Pushing the Frontiers of Omni-Modal Language Model with Progressive Modality Alignment
arXiv2025-02-06GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
arXiv2025-01-30GithubVisual/Audio/Text
➜Text
✅❌
Star
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
arXiv2025-01-25GithubVisual/Audio/Text
➜Text
✅❌
Star
MiniCPM-o 2.6: A GPT-4o Level MLLM for Vision, Speech, and Multimodal Live Streaming on Your Phone
blog2025-01-24GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
arXiv2025-01-16GithubVisual/Audio/Text
➜Text
✅❌
Star
OpenOmni: A Fully Open-Source Omni Large Language Model with Real-time Self-Aware Emotional Speech Synthesis
arXiv2025-01-09GithubVisual/Audio/Text
➜Text/Audio
✅✅
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
arXiv2024-12-23-Visual/Audio/Text
➜Text
✅❌
Star
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
arXiv2024-12-20GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
arXiv2024-12-12GithubVisual/Audio/Text
➜Text
✅❌
Star
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
arXiv2024-12-09GithubVisual/Audio/Text
➜Text/Audio
✅✅
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
CVPR2024-11-29-Visual/Audio/Text
➜Text
✅❌
Star
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
arXiv2024-11-25GithubVisual/Audio/Text
➜Text
✅❌
Spider: Any-to-Many Multimodal LLM
arXiv2024-11-14-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Towards Multi-Modal Mastery: A 4.5B Parameter Truly Multi-Modal Small Language Model
arXiv2024-11-08-Visual/Audio/Text
➜Text/Audio
✅✅
Star
CAD-MLLM: Unifying Multimodality-ConditionedCAD Generation With MLLM
arXiv2024-11-07GithubVisual/3D/Text
➜Text/3D
✅✅
Star
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
NeurIPS2024-10-26GithubVisual/Audio/3D/Depth/Text
➜Text
✅❌
OMCAT Omni Context Aware Transformer
arXiv2024-10-15-Visual/Audio/Text
➜Text
✅❌
Star
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
NeurIPS2024-10-15GithubVisual/Audio/Text
➜Text/Audio
✅✅
Aligned Better, Listen Better For Audio-Visual Large Language Models
ICLR2024-10-13-Visual/Audio/Text
➜Text
✅❌
Star
Baichuan-Omni Technical Report
arXiv2024-10-11GithubVisual/Audio/Text
➜Text
✅❌
Efficient Generative Multimodal Integration (EGMI): Enabling Audio Generation from Text-Image Pairs through Alignment with Large Language Models
NeurIPS
Workshop
2024-10-11-Visual/Audio/Text
➜Text/Audio
✅✅
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
arXiv2024-10-09-Visual/Audio/Text
➜Text
✅❌
Large Language Models Are Strong Audio-Visual Speech Recognition Learners
ICASSP2024-09-18-Visual/Audio/Text
➜Text
✅❌
Star
VITA: Towards Open-Source Interactive Omni Multimodal LLM
arXiv2024-08-05GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
arXiv2024-08-03GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
InternOmni: Extending InternVL with Audio Modality
blog2024-07-31-Visual/Audio/Text
➜Text
✅❌
Star
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
arXiv2024-07-01GithubVisual/Audio/Text
➜Text
✅❌
Star
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
arXiv2024-06-22GithubVisual/Audio/Text
➜Text
✅❌
Star
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
NIPS2024-06-17GithubVisual/Audio/Text
➜Text
✅❌
Star
VideoLLaMA 2 Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
arXiv2024-06-11GithubVisual/Audio/Text
➜Text
✅❌
Star
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
ACL2024-06-06GithubVisual/Audio/Text
➜Text
✅❌
X-VILA: Cross-Modality Alignment for Large Language Model
arXiv2024-05-29-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
TPAMI2024-05-18GithubVisual/Audio/Text
➜Text
✅❌
Star
Querying as Prompt: Parameter-Efficient Learning for Multimodal Language Model
CVPR2024-05-06GithubVisual/Audio/Text
➜Text
✅❌
Star
WorldGPT: Empowering LLM as Multimodal World Model
AAAI2024-04-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
arXiv2024-03-24-Visual/Audio/Text
➜Text
✅❌
Star
CAT : Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
ECCV2024-03-04GithubVisual/Audio/Text
➜Text
✅❌
Star
Model Composition for Multimodal Large Language Models
ACL2024-02-18GithubVisual/Audio/3D/Text
➜Text
✅❌
Star
GroundingGPT: Language Enhanced Multi-modal Grounding Model
ACL2024-02-11GithubVisual/Audio/Text
➜Text
✅❌
Star
MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning
ECCV2024-01-19GithubVisual/Audio/Text
➜Text/Visual
✅✅
Star
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
CVPR2024-01-16GithubVisual/3D/Touch/Text
➜Text
✅❌
Star
ModaVerse: Efficiently Transforming Modalities with LLMs
CVPR2024-01-12GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Actions
CVPR2023-12-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
M3DBench: Towards Omni 3D Assistant with Interleaved Multi-modal Instructions
ECCV2023-12-17GithubVisual/3D/Text
➜Text
✅❌
Star
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
arXiv2023-12-14GithubVisual/3D/Text
➜Text
✅❌
Audio-Visual LLM for Video Understanding
arXiv2023-12-11-Visual/Audio/Text
➜Text
✅❌
Star
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
ECCV2023-11-30GithubVisual/Audio/3D/Text
➜Text
✅❌
Star
Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE
ICLR2023-11-05GithubVisual/3D/Text
➜Text
✅❌
Star
Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
arXiv2023-10-09GithubVisual/Audio/Text
➜Text
✅❌
Star
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
EMNLP
industry
2023-09-27GithubVisual/Audio/IMU/Text
➜Text
✅❌
Star
NExT-GPT: Any-to-Any Multimodal LLM
ICML2023-09-11GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs
arXiv2023-07-17GithubVisual/Audio/Text
➜Text
✅❌
Star
Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration
arXiv2023-06-15GithubVisual/Audio/Text
➜Text
✅❌
Star
LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark
NerIPS2023-06-13GithubVisual/3D/Text
➜Text
✅❌
Star
Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
EMNLP
demo
2023-06-05GithubVisual/Audio/Text
➜Text
✅❌
Star
ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst
arXiv2023-05-25GithubVisual/Audio/Text
➜Text
✅❌
Star
X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages
arXiv2023-05-07GithubVisual/Audio/Text
➜Text
✅❌
Star
eP-ALM: Efficient Perceptual Augmentation of Language Models
ICCV2023-03-20GithubVisual/Audio/Text
➜Text
✅❌

🌲Uni-branch Continuous Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
NeurIPS2024-10-26GithubVisual/Audio/3D/Depth/Text
➜Text/Audio
✅❌
Efficient Generative Multimodal Integration (EGMI): Enabling Audio Generation from Text-Image Pairs through Alignment with Large Language Models
NeurIPS
Workshop
2024-10-11-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
ACL
Demo
2024-06-21GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
WorldGPT: Empowering LLM as Multimodal World Model
MM2024-04-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
A Touch, Vision, and Language Dataset for Multimodal Alignment
ICML2024-02-20GithubVisual/Touch/Text
➜Text
✅❌
Star
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
ICLR2024-02-08GithubVisual/Audio/3D/Depth/
Thremal/Text➜Text
✅❌
Star
OneLLM: One Framework to Align All Modalities with Language
CVPR2023-11-30GithubVisual/Audio/3D/Depth/
IMU/Text➜Text
✅❌
Star
CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation
CVPR2023-11-30GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
ImageBind-LLM: Multi-modality Instruction Tuning
arXiv2023-09-11GithubVisual/Audio/3D/
Text➜Text
✅❌
Star
PandaGPT: One Model To Instruction-Follow Them All
tllm2023-05-25GithubVisual/Audio/3D/Depth/
Thremal/Text➜Text
✅❌

🧩Diserect Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
Arxiv2025-10-15-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters
Arxiv2024-12-29-Visual/Audio/Motion/
Text➜Text/Audio/Motion
✅✅
LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis
Arxiv2024-10-06-Visual/Audio/Motion/
Text➜Text/Audio/Motion
✅✅
Star
MIO: A Foundation Model on Multimodal Tokens
Arxiv2024-09-26GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
Arxiv2024-09-05-Action/3D/Text
➜Text/3D/Action
✅✅
Star
M3GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
NeurIPS2024-02-19GithubAudio/Motion/Text
➜Text/Audio/Motion
✅✅
Star
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
ACL2024-02-19GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
Arxiv2023-11-08-Visual/Audio/Text
➜Text
✅❌

🔀Hybrid Omni-MLLMs

TitleVenueDateCodeDemoCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
arXiv2025-06-02GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star RoboEgo System Card: An Omnimodal Model with Native Full Duplexity
arXiv2025-06-02GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
arXiv2025-06-02--Visual/3D/Text
➜Text/3D
✅✅
Star
Baichuan-Omni-1.5 Technical Report
arXiv2025-01-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons
Arxiv2024-12-11-Visual/Action/Text
➜Text/Action
✅✅
Star
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
CVPR2024-09-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
Grounding Multimodal Large Language Models in Actions
NeurIPS2024-06-12-Visual/Action/Text
➜Text/Action
✅✅
Star
An Embodied Generalist Agent in 3D World
ICML2023-11-18GithubVisual/3D/Action/
Text➜Text
✅❌

🧪Cross-Modality Benchmark

📌Input-Output format: X+Y+Text➜Text or X+Y+Text➜X

📊Comprehensive Understanding Benchmark

TitleNameDateDownloadModality
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
FutureOmni2026-01--Video,Audio,
Text
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
LiViBench2026-01--Video,Audio,
Text
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
OmniVideoBench2025-10-12HuggingfaceVideo,Audio,
Text
Unobench: A unified benchmark for exploring the compositional law between uni-modal and omni-modal in omni models
UNO-Bench2025-10GithubVideo,Audio,
Text
VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
VoiceAssistant-Eval2025-09-26HuggingfaceImage,Audio,
Text
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
HumanSense2025-08-14GithubVideo,Audio,
Text
VGGSounder: Audio-Visual Evaluations for Foundation Models
VGGSounder2025-08-14HuggingfaceVideo,Audio,
Text
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
OmniEval2025-06-26HuggingfaceVideo,Audio,
Text
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Daily-Omni2025-05-23--Video,Audio,
Text
AURELIA: Test-time Reasoning Distillation in Audio-Visual LLMs
AVReasonBench2025-03-29--Video,Audio,
Text
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
OmniMMI2025-03-28HuggingfaceVideo,Audio,
Text
MAVERIX: Multimodal Audio-Visual Evaluation Reasoning IndeX
MAVERIX2025-03-27--Video,Audio,
Text
ACVUBench: Audio-Centric Video Understanding Benchmark
ACVUBench2025-03-25--Video,Audio,
Text
DAVE : Diagnostic benchmark for Audio Visual Evaluation
DAVE2025-03-12--Video,Audio,
Text
Star
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
AVRBench2025-02-17HuggingfaceVideo,Audio,
Text
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
WorldSense2025-02-06HuggingfaceImage,Video,
Audio,Text
AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs
AVTrustBench2025-01-03-Image,Video,
Audio,Text
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
AMU2024-12-20-Image,Video,
Audio,Text
OmniBench: Towards The Future of Universal Omni-Language Models
OmniBench2024-12-11HuggingfaceImage,Audio,
Text
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
AV-Odyssey
Bench
2024-12-03HuggingfaceImage,Video,
Audio,Text
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
AVHBench2024-10-23Google Driver
Google Driver
Image,Video,
Audio,Text
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
LongVALE2024-10-16-Image,Video,
Audio,Text
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
Curse2024-10-16HuggingfaceImage,Video,
Audio,Text
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
OmnixR2024-10-16HuggingfaceImage,Video,
Audio,Text
ShareGPT-4o: Comprehensive Multimodal Annotations With GPT-4o
ShareGPT-4o2024-08-06HuggingfaceImage,Video,
Audio,Text
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
SAVE2024-06-22HuggingfaceImage,Video,
Audio,Text
Model Composition for Multimodal Large Language Models
MCUB2024-02-20-Image,Audio,
3D,Text
A Touch, Vision, and Language Dataset for Multimodal Alignment
TVL
Benchmark
2024-02-20-Image,Touch,
Text
X-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-Modal Reasoning
DisCRn2023-11-30GithubImage,Audio,
3D,Text

📉Down-Streaming Understanding Benchmark

TitleNameDateDownloadModality
ChronusOmni: Improving Time Awareness of Omni Large Language Models
ChronusAV2025-12-10GithubVideo,Audio,
Text
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
OmniGuard2025-12-02--Video,Audio,
Text
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
OmniPlay2025-08-06GithubVideo,Audio,
Text
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
R2-AVSBench2025-08-06Google DriverVideo,Audio,
Image,Text
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
OmniAVS2025-07-30HuggingfaceVideo,Audio,
Text
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
VideoMind2025-07-24HuggingfaceVideo,Audio,
Text
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
AnyCap2025-07-16HuggingfaceVideo,Audio,
Text
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
UGC-VideoCap2025-07-15HuggingfaceVideo,Audio,
Text
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
SAVVY-Bench2025-06-04-Video,Audio,
Text
Multimodal Conversation Structure Understanding
TV-MMPC2025-05-23-Video,Audio,
Text
FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
FortisAVQA2025-04-01-Video,Audio,
Text
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
Ref-AVS2024-07-15DatasetImage,Video,
Audio,Text
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
MUIE2024-06-06-Image,Video,
Audio,Text
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
MUSIC-AVQA-R2024-04-18-Video,Audio,
Text
Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering
MUSIC-AVQA v2.02023-10-10DropBoxVideo,Audio,
Text
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
VALOR-32K2023-04-17BaiduDisk
BaiduDisk
Video,Audio,
Text
Dense-Localizing Audio-Visual Events in Untrimmed Videos: A Large-Scale Benchmark and Baseline
UnAV-100
test
2023-03-22-Video,Audio,
Text
AVQA: A Dataset for Audio-Visual Question Answering on Videos
AVQA2022-10-10DatasetVideo,Audio,
Text
Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing
LLP2022-07-21--Video,Audio,
Text
Learning to Answer Questions in Dynamic Audio-Visual Scenarios
Music-AVQA2022-05-26Google Driver
Github
Video,Audio,
Text
Pano-AVQA: Grounded Audio-Visual Question Answering on 360 Videos
Pano-AVQA2021-10-11--Video,Audio,
Text
VGGSound: A Large-scale Audio-Visual Dataset
VGGSound2020-04-29HuggingfaceVideo,Audio,
Text
Audio Visual Scene-Aware Dialog
AVSD2019-01-25DatasetVideo,Audio,
Text

🔍Uni-Modality Benchmark

📌Input-Output format: X+Text➜Text or X+Text➜X

🔄Any2Any Benchmark

TitleNameDateDownloadModality
Judge Anything: MLLM as a Judge Across Any Modality
TaskAnything2025-03-21HuggingfaceVideo,Image,
Audio,Text
MixEval-X: Any-to-Any Evaluations from Real-World Data Mixtures
MixEval-X2024-10-17HuggingfaceVideo,Image,
Audio,Text

Star History

Star History Chart

threegold116/Awesome-Omni-MLLMs

This is for ACL 2025 Findings Paper: From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalitiesModels

104

81 commits

updated Mar 22, 2026

See the code

README

From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities

Shixin Jiang1∗, Jiafeng Liang1, Jiyuan Wang1, Xuan Dong1, Heng Chang3, Weijiang Yu3, Jinhua Du4, Ming Liu1†,2, Bing Qin1,2
1Harbin Institute of Technology, Harbin, China
2Peng Cheng Laboratory, Shenzhen, China
3Huawei Inc., Shenzhen, China
4Huawei London Research Centre, London, UK

This repository contains the resources for arxiv paper From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities

taxonomy

For more details, please refer to the paper: From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities.

📢 Updates

visitors

  • 2025/05/16 Our paper is accepted as ACL2025 Findings 🎉.
  • 2025/02/28 We have updated 23 papers in the reading list 📚.
  • 2025/02/20 We have updated 55 papers first in the reading list 📚.
  • 2025/02/15 The second version of our paper has been released, check it on arxiv 🎓.
  • 2024/12/16 The first version of our paper is available on arxiv 🎓.

This reading list will be updated periodically, and if you have any suggestions or find some we missed, feel free to contact us! You can submit an issue or send an email (sxjiang@ir.hit.edu.cn).

🗂️ Tables of Contents

🧠Awesome Omni-MLLMs

Omni-MLLM: The MLLMs which can handle more than 2 extra-linguistic modalities.

🌿Multi-branch Continuous Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star OmniGAIA: Towards Native Omni-Modal AI Agents
Arxiv2026-02-28GithubVisual/Audio/Text
➜Text
✅❌
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
Arxiv2026-02-28--Visual/Audio/Text
➜Text
✅❌
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
Arxiv2026-02-15--Visual/Audio/Text
➜Text
✅❌
Star Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
Arxiv2026-02-10GithubVisual/Audio/Text
➜Text
✅❌
Star ChronusOmni: Improving Time Awareness of Omni Large Language Models
Arxiv2025-12-10GithubVisual/Audio/Text
➜Text
✅❌
Star Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
Arxiv2025-12-03GithubVisual/Audio/Text
➜Text
✅❌
Star Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
Arxiv2025-11-16GithubVisual/Audio/Text
➜Text/Audio/Visual
✅✅
Star Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
Arxiv2025-11-10GithubVisual/Audio/Text
➜Text
✅❌
Star LongCat-Flash-Omni Technical Report
Arxiv2025-10-31GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
Arxiv2025-10-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
Arxiv2025-10-27GithubVisual/Audio/Text
➜Scalar
✅❌
Star RoboOmni: Proactive Robot Manipulation in Omni-modal Context
Arxiv2025-10-27GithubVisual/Audio/Text
➜Text/Audio/Action
✅✅
Star OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
Arxiv2025-10-17GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
Arxiv2025-10-15GithubVisual/Audio/Text
➜Text/Audio
✅✅
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
NIPS2025-10-05--Visual/Audio/Text
➜Text
✅❌
Star
Qwen3-Omni Technical Report
arXiv2025-09-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
Arxiv2025-08-20GithubVisual/Audio/Text
➜Text
✅❌
Star Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
Arxiv2025-08-06--Visual/Audio/Text
➜Text
✅❌
Star VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
Arxiv2025-08-04--Visual/Audio/Text
➜Text
✅✅
AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
Arxiv2025-08-04--Visual/Audio/Text
➜Text
✅❌
StarTowards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
ICCV2025-07-30--Visual/Audio/Text
➜Text
✅❌
StarARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
Arxiv2025-07-29--Visual/Audio/Text
➜Text
✅❌
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
Arxiv2025-07-15--Visual/Audio/Text
➜Text
✅✅
Star HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
Arxiv2025-06-26GithubVisual/Audio/Text
➜Text
✅❌
video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language Models
Arxiv2025-06-05--Visual/Audio/Text
➜Text
✅❌
Star AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
Arxiv2025-06-05GithubVisual/Audio/Text
➜Text
✅❌
Star Is Extending Modality The Right Path Towards Omni-Modality?
Arxiv2025-06-02GithubVisual/Audio/Text
➜Text
✅❌
Star Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Star Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Star Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
Arxiv2025-05-26GithubVisual/Audio/Text
➜Text
✅❌
Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
Arxiv2025-05-23--Visual/Audio/Text
➜Text
✅❌
Star Ming-Omni: A Unified Multimodal Model for Perception and Generation
Arxiv2025-05-07GithubVisual/Audio/Text
➜Text/Audio/Visual
✅✅
Star EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
Arxiv2025-05-07GithubVisual/Audio/Text
➜Text
✅❌
Star Multimodal Long Video Modeling Based on Temporal Dynamic Context
Arxiv2025-04-14GithubVisual/Audio/Text
➜Text
✅❌
Star Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
ICLR
Workshop
2025-04-10GithubVisual/Audio/Text
➜Text
✅❌
Star FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
Arxiv2025-04-01GithubVisual/Audio/Text
➜Text
✅❌
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
arXiv2025-03-31-Visual/Audio/Text
➜Text
✅❌
Star
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
CVPR2025-03-28GithubVisual/Audio/Text
➜Text
✅❌
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
arXiv2025-03-27-Visual/Audio/Text
➜Text/Audio
✅✅
Star
Qwen2.5-Omni Technical Report
arXiv2025-03-27GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Vision-Speech Models: Teaching Speech Models to Converse about Images
arXiv2025-03-20GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
ViSpeak: Visual Instruction Feedback in Streaming Videos
arXiv2025-03-17GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
CVPR2025-03-17GithubVisual/Audio/Text
➜Text
✅❌
Star
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
arXiv2025-03-14GithubVisual/Audio/Text
➜Text
✅❌
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
arXiv2025-03-11-Visual/3D/Text
➜Text
✅❌
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
arXiv2025-03-09-Visual/Audio/Text
➜Text
✅❌
Star
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcing Learning
arXiv2025-03-07GithubVisual/Audio/Text
➜Text
✅❌
Star
EgoLife: Towards Egocentric Life Assistant
CVPR2025-03-05GithubVisual/Audio/Text
➜Text
✅❌
Star
Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
arXiv2025-03-03GithubVisual/Audio/Text
➜Text
✅❌
Nexus-O: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
arXiv2025-02-26Visual/Audio/Text
➜Text/Audio
✅✅
Star
Megrez-Omni Technical Report
arXiv2025-02-19GithubVisual/Audio/Text
➜Text
✅❌
Star
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
ICML2025-02-17GithubVisual/Audio/Text
➜Text
✅❌
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
WWW2025-02-07-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance
arXiv2025-02-06-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Ola: Pushing the Frontiers of Omni-Modal Language Model with Progressive Modality Alignment
arXiv2025-02-06GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
arXiv2025-01-30GithubVisual/Audio/Text
➜Text
✅❌
Star
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
arXiv2025-01-25GithubVisual/Audio/Text
➜Text
✅❌
Star
MiniCPM-o 2.6: A GPT-4o Level MLLM for Vision, Speech, and Multimodal Live Streaming on Your Phone
blog2025-01-24GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
arXiv2025-01-16GithubVisual/Audio/Text
➜Text
✅❌
Star
OpenOmni: A Fully Open-Source Omni Large Language Model with Real-time Self-Aware Emotional Speech Synthesis
arXiv2025-01-09GithubVisual/Audio/Text
➜Text/Audio
✅✅
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
arXiv2024-12-23-Visual/Audio/Text
➜Text
✅❌
Star
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
arXiv2024-12-20GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
arXiv2024-12-12GithubVisual/Audio/Text
➜Text
✅❌
Star
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
arXiv2024-12-09GithubVisual/Audio/Text
➜Text/Audio
✅✅
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
CVPR2024-11-29-Visual/Audio/Text
➜Text
✅❌
Star
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
arXiv2024-11-25GithubVisual/Audio/Text
➜Text
✅❌
Spider: Any-to-Many Multimodal LLM
arXiv2024-11-14-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Towards Multi-Modal Mastery: A 4.5B Parameter Truly Multi-Modal Small Language Model
arXiv2024-11-08-Visual/Audio/Text
➜Text/Audio
✅✅
Star
CAD-MLLM: Unifying Multimodality-ConditionedCAD Generation With MLLM
arXiv2024-11-07GithubVisual/3D/Text
➜Text/3D
✅✅
Star
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
NeurIPS2024-10-26GithubVisual/Audio/3D/Depth/Text
➜Text
✅❌
OMCAT Omni Context Aware Transformer
arXiv2024-10-15-Visual/Audio/Text
➜Text
✅❌
Star
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
NeurIPS2024-10-15GithubVisual/Audio/Text
➜Text/Audio
✅✅
Aligned Better, Listen Better For Audio-Visual Large Language Models
ICLR2024-10-13-Visual/Audio/Text
➜Text
✅❌
Star
Baichuan-Omni Technical Report
arXiv2024-10-11GithubVisual/Audio/Text
➜Text
✅❌
Efficient Generative Multimodal Integration (EGMI): Enabling Audio Generation from Text-Image Pairs through Alignment with Large Language Models
NeurIPS
Workshop
2024-10-11-Visual/Audio/Text
➜Text/Audio
✅✅
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
arXiv2024-10-09-Visual/Audio/Text
➜Text
✅❌
Large Language Models Are Strong Audio-Visual Speech Recognition Learners
ICASSP2024-09-18-Visual/Audio/Text
➜Text
✅❌
Star
VITA: Towards Open-Source Interactive Omni Multimodal LLM
arXiv2024-08-05GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
arXiv2024-08-03GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
InternOmni: Extending InternVL with Audio Modality
blog2024-07-31-Visual/Audio/Text
➜Text
✅❌
Star
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
arXiv2024-07-01GithubVisual/Audio/Text
➜Text
✅❌
Star
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
arXiv2024-06-22GithubVisual/Audio/Text
➜Text
✅❌
Star
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
NIPS2024-06-17GithubVisual/Audio/Text
➜Text
✅❌
Star
VideoLLaMA 2 Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
arXiv2024-06-11GithubVisual/Audio/Text
➜Text
✅❌
Star
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
ACL2024-06-06GithubVisual/Audio/Text
➜Text
✅❌
X-VILA: Cross-Modality Alignment for Large Language Model
arXiv2024-05-29-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
TPAMI2024-05-18GithubVisual/Audio/Text
➜Text
✅❌
Star
Querying as Prompt: Parameter-Efficient Learning for Multimodal Language Model
CVPR2024-05-06GithubVisual/Audio/Text
➜Text
✅❌
Star
WorldGPT: Empowering LLM as Multimodal World Model
AAAI2024-04-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
arXiv2024-03-24-Visual/Audio/Text
➜Text
✅❌
Star
CAT : Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
ECCV2024-03-04GithubVisual/Audio/Text
➜Text
✅❌
Star
Model Composition for Multimodal Large Language Models
ACL2024-02-18GithubVisual/Audio/3D/Text
➜Text
✅❌
Star
GroundingGPT: Language Enhanced Multi-modal Grounding Model
ACL2024-02-11GithubVisual/Audio/Text
➜Text
✅❌
Star
MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning
ECCV2024-01-19GithubVisual/Audio/Text
➜Text/Visual
✅✅
Star
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
CVPR2024-01-16GithubVisual/3D/Touch/Text
➜Text
✅❌
Star
ModaVerse: Efficiently Transforming Modalities with LLMs
CVPR2024-01-12GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Actions
CVPR2023-12-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
M3DBench: Towards Omni 3D Assistant with Interleaved Multi-modal Instructions
ECCV2023-12-17GithubVisual/3D/Text
➜Text
✅❌
Star
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
arXiv2023-12-14GithubVisual/3D/Text
➜Text
✅❌
Audio-Visual LLM for Video Understanding
arXiv2023-12-11-Visual/Audio/Text
➜Text
✅❌
Star
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
ECCV2023-11-30GithubVisual/Audio/3D/Text
➜Text
✅❌
Star
Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE
ICLR2023-11-05GithubVisual/3D/Text
➜Text
✅❌
Star
Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
arXiv2023-10-09GithubVisual/Audio/Text
➜Text
✅❌
Star
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
EMNLP
industry
2023-09-27GithubVisual/Audio/IMU/Text
➜Text
✅❌
Star
NExT-GPT: Any-to-Any Multimodal LLM
ICML2023-09-11GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs
arXiv2023-07-17GithubVisual/Audio/Text
➜Text
✅❌
Star
Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration
arXiv2023-06-15GithubVisual/Audio/Text
➜Text
✅❌
Star
LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark
NerIPS2023-06-13GithubVisual/3D/Text
➜Text
✅❌
Star
Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
EMNLP
demo
2023-06-05GithubVisual/Audio/Text
➜Text
✅❌
Star
ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst
arXiv2023-05-25GithubVisual/Audio/Text
➜Text
✅❌
Star
X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages
arXiv2023-05-07GithubVisual/Audio/Text
➜Text
✅❌
Star
eP-ALM: Efficient Perceptual Augmentation of Language Models
ICCV2023-03-20GithubVisual/Audio/Text
➜Text
✅❌

🌲Uni-branch Continuous Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
NeurIPS2024-10-26GithubVisual/Audio/3D/Depth/Text
➜Text/Audio
✅❌
Efficient Generative Multimodal Integration (EGMI): Enabling Audio Generation from Text-Image Pairs through Alignment with Large Language Models
NeurIPS
Workshop
2024-10-11-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
ACL
Demo
2024-06-21GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
WorldGPT: Empowering LLM as Multimodal World Model
MM2024-04-28GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
A Touch, Vision, and Language Dataset for Multimodal Alignment
ICML2024-02-20GithubVisual/Touch/Text
➜Text
✅❌
Star
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
ICLR2024-02-08GithubVisual/Audio/3D/Depth/
Thremal/Text➜Text
✅❌
Star
OneLLM: One Framework to Align All Modalities with Language
CVPR2023-11-30GithubVisual/Audio/3D/Depth/
IMU/Text➜Text
✅❌
Star
CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation
CVPR2023-11-30GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
Star
ImageBind-LLM: Multi-modality Instruction Tuning
arXiv2023-09-11GithubVisual/Audio/3D/
Text➜Text
✅❌
Star
PandaGPT: One Model To Instruction-Follow Them All
tllm2023-05-25GithubVisual/Audio/3D/Depth/
Thremal/Text➜Text
✅❌

🧩Diserect Omni-MLLMs

TitleVenueDateCodeModalitiesCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
Arxiv2025-10-15-Visual/Audio/Text
➜Text/Visual/Audio
✅✅
SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters
Arxiv2024-12-29-Visual/Audio/Motion/
Text➜Text/Audio/Motion
✅✅
LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis
Arxiv2024-10-06-Visual/Audio/Motion/
Text➜Text/Audio/Motion
✅✅
Star
MIO: A Foundation Model on Multimodal Tokens
Arxiv2024-09-26GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
Arxiv2024-09-05-Action/3D/Text
➜Text/3D/Action
✅✅
Star
M3GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
NeurIPS2024-02-19GithubAudio/Motion/Text
➜Text/Audio/Motion
✅✅
Star
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
ACL2024-02-19GithubVisual/Audio/Text
➜Text/Visual/Audio
✅✅
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
Arxiv2023-11-08-Visual/Audio/Text
➜Text
✅❌

🔀Hybrid Omni-MLLMs

TitleVenueDateCodeDemoCross(Omni)-modal
Understanding
Cross(Omni)-modal
Generation
Star
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
arXiv2025-06-02GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star RoboEgo System Card: An Omnimodal Model with Native Full Duplexity
arXiv2025-06-02GithubVisual/Audio/Text
➜Text/Audio
✅✅
Star
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
arXiv2025-06-02--Visual/3D/Text
➜Text/3D
✅✅
Star
Baichuan-Omni-1.5 Technical Report
arXiv2025-01-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons
Arxiv2024-12-11-Visual/Action/Text
➜Text/Action
✅✅
Star
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
CVPR2024-09-26GithubVisual/Audio/Text
➜Text/Audio
✅✅
Grounding Multimodal Large Language Models in Actions
NeurIPS2024-06-12-Visual/Action/Text
➜Text/Action
✅✅
Star
An Embodied Generalist Agent in 3D World
ICML2023-11-18GithubVisual/3D/Action/
Text➜Text
✅❌

🧪Cross-Modality Benchmark

📌Input-Output format: X+Y+Text➜Text or X+Y+Text➜X

📊Comprehensive Understanding Benchmark

TitleNameDateDownloadModality
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
FutureOmni2026-01--Video,Audio,
Text
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
LiViBench2026-01--Video,Audio,
Text
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
OmniVideoBench2025-10-12HuggingfaceVideo,Audio,
Text
Unobench: A unified benchmark for exploring the compositional law between uni-modal and omni-modal in omni models
UNO-Bench2025-10GithubVideo,Audio,
Text
VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
VoiceAssistant-Eval2025-09-26HuggingfaceImage,Audio,
Text
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
HumanSense2025-08-14GithubVideo,Audio,
Text
VGGSounder: Audio-Visual Evaluations for Foundation Models
VGGSounder2025-08-14HuggingfaceVideo,Audio,
Text
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
OmniEval2025-06-26HuggingfaceVideo,Audio,
Text
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Daily-Omni2025-05-23--Video,Audio,
Text
AURELIA: Test-time Reasoning Distillation in Audio-Visual LLMs
AVReasonBench2025-03-29--Video,Audio,
Text
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
OmniMMI2025-03-28HuggingfaceVideo,Audio,
Text
MAVERIX: Multimodal Audio-Visual Evaluation Reasoning IndeX
MAVERIX2025-03-27--Video,Audio,
Text
ACVUBench: Audio-Centric Video Understanding Benchmark
ACVUBench2025-03-25--Video,Audio,
Text
DAVE : Diagnostic benchmark for Audio Visual Evaluation
DAVE2025-03-12--Video,Audio,
Text
Star
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
AVRBench2025-02-17HuggingfaceVideo,Audio,
Text
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
WorldSense2025-02-06HuggingfaceImage,Video,
Audio,Text
AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs
AVTrustBench2025-01-03-Image,Video,
Audio,Text
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
AMU2024-12-20-Image,Video,
Audio,Text
OmniBench: Towards The Future of Universal Omni-Language Models
OmniBench2024-12-11HuggingfaceImage,Audio,
Text
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
AV-Odyssey
Bench
2024-12-03HuggingfaceImage,Video,
Audio,Text
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
AVHBench2024-10-23Google Driver
Google Driver
Image,Video,
Audio,Text
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
LongVALE2024-10-16-Image,Video,
Audio,Text
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
Curse2024-10-16HuggingfaceImage,Video,
Audio,Text
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
OmnixR2024-10-16HuggingfaceImage,Video,
Audio,Text
ShareGPT-4o: Comprehensive Multimodal Annotations With GPT-4o
ShareGPT-4o2024-08-06HuggingfaceImage,Video,
Audio,Text
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
SAVE2024-06-22HuggingfaceImage,Video,
Audio,Text
Model Composition for Multimodal Large Language Models
MCUB2024-02-20-Image,Audio,
3D,Text
A Touch, Vision, and Language Dataset for Multimodal Alignment
TVL
Benchmark
2024-02-20-Image,Touch,
Text
X-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-Modal Reasoning
DisCRn2023-11-30GithubImage,Audio,
3D,Text

📉Down-Streaming Understanding Benchmark

TitleNameDateDownloadModality
ChronusOmni: Improving Time Awareness of Omni Large Language Models
ChronusAV2025-12-10GithubVideo,Audio,
Text
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
OmniGuard2025-12-02--Video,Audio,
Text
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
OmniPlay2025-08-06GithubVideo,Audio,
Text
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
R2-AVSBench2025-08-06Google DriverVideo,Audio,
Image,Text
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
OmniAVS2025-07-30HuggingfaceVideo,Audio,
Text
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
VideoMind2025-07-24HuggingfaceVideo,Audio,
Text
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
AnyCap2025-07-16HuggingfaceVideo,Audio,
Text
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
UGC-VideoCap2025-07-15HuggingfaceVideo,Audio,
Text
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
SAVVY-Bench2025-06-04-Video,Audio,
Text
Multimodal Conversation Structure Understanding
TV-MMPC2025-05-23-Video,Audio,
Text
FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
FortisAVQA2025-04-01-Video,Audio,
Text
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
Ref-AVS2024-07-15DatasetImage,Video,
Audio,Text
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
MUIE2024-06-06-Image,Video,
Audio,Text
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
MUSIC-AVQA-R2024-04-18-Video,Audio,
Text
Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering
MUSIC-AVQA v2.02023-10-10DropBoxVideo,Audio,
Text
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
VALOR-32K2023-04-17BaiduDisk
BaiduDisk
Video,Audio,
Text
Dense-Localizing Audio-Visual Events in Untrimmed Videos: A Large-Scale Benchmark and Baseline
UnAV-100
test
2023-03-22-Video,Audio,
Text
AVQA: A Dataset for Audio-Visual Question Answering on Videos
AVQA2022-10-10DatasetVideo,Audio,
Text
Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing
LLP2022-07-21--Video,Audio,
Text
Learning to Answer Questions in Dynamic Audio-Visual Scenarios
Music-AVQA2022-05-26Google Driver
Github
Video,Audio,
Text
Pano-AVQA: Grounded Audio-Visual Question Answering on 360 Videos
Pano-AVQA2021-10-11--Video,Audio,
Text
VGGSound: A Large-scale Audio-Visual Dataset
VGGSound2020-04-29HuggingfaceVideo,Audio,
Text
Audio Visual Scene-Aware Dialog
AVSD2019-01-25DatasetVideo,Audio,
Text

🔍Uni-Modality Benchmark

📌Input-Output format: X+Text➜Text or X+Text➜X

🔄Any2Any Benchmark

TitleNameDateDownloadModality
Judge Anything: MLLM as a Judge Across Any Modality
TaskAnything2025-03-21HuggingfaceVideo,Image,
Audio,Text
MixEval-X: Any-to-Any Evaluations from Real-World Data Mixtures
MixEval-X2024-10-17HuggingfaceVideo,Image,
Audio,Text

Star History

Star History Chart