OmniGAIA: Towards Native Omni-Modal AI Agents
| Arxiv | 2026-02-28 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
| Arxiv | 2026-02-28 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
| Arxiv | 2026-02-15 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
| Arxiv | 2026-02-10 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
ChronusOmni: Improving Time Awareness of Omni Large Language Models
| Arxiv | 2025-12-10 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
| Arxiv | 2025-12-03 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
| Arxiv | 2025-11-16 | Github | Visual/Audio/Text ➜Text/Audio/Visual | ✅ | ✅ |
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
| Arxiv | 2025-11-10 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
LongCat-Flash-Omni Technical Report
| Arxiv | 2025-10-31 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
| Arxiv | 2025-10-28 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
| Arxiv | 2025-10-27 | Github | Visual/Audio/Text ➜Scalar | ✅ | ❌ |
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
| Arxiv | 2025-10-27 | Github | Visual/Audio/Text ➜Text/Audio/Action | ✅ | ✅ |
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
| Arxiv | 2025-10-17 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
| Arxiv | 2025-10-15 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
| NIPS | 2025-10-05 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
Qwen3-Omni Technical Report
| arXiv | 2025-09-26 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
| Arxiv | 2025-08-20 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
| Arxiv | 2025-08-06 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
| Arxiv | 2025-08-04 | -- | Visual/Audio/Text ➜Text | ✅ | ✅ |
AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
| Arxiv | 2025-08-04 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
| ICCV | 2025-07-30 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
| Arxiv | 2025-07-29 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
| Arxiv | 2025-07-15 | -- | Visual/Audio/Text ➜Text | ✅ | ✅ |
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
| Arxiv | 2025-06-26 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language Models
| Arxiv | 2025-06-05 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
| Arxiv | 2025-06-05 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Is Extending Modality The Right Path Towards Omni-Modality?
| Arxiv | 2025-06-02 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
| Arxiv | 2025-05-26 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
| Arxiv | 2025-05-26 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Unifying Multimodal Large Language Model Capabilities and Modalities via Model Merging
| Arxiv | 2025-05-26 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
| Arxiv | 2025-05-23 | -- | Visual/Audio/Text ➜Text | ✅ | ❌ |
Ming-Omni: A Unified Multimodal Model for Perception and Generation
| Arxiv | 2025-05-07 | Github | Visual/Audio/Text ➜Text/Audio/Visual | ✅ | ✅ |
EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
| Arxiv | 2025-05-07 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Multimodal Long Video Modeling Based on Temporal Dynamic Context
| Arxiv | 2025-04-14 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
| ICLR Workshop | 2025-04-10 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
| Arxiv | 2025-04-01 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
| arXiv | 2025-03-31 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
| CVPR | 2025-03-28 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
| arXiv | 2025-03-27 | - | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Qwen2.5-Omni Technical Report
| arXiv | 2025-03-27 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Vision-Speech Models: Teaching Speech Models to Converse about Images
| arXiv | 2025-03-20 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
ViSpeak: Visual Instruction Feedback in Streaming Videos
| arXiv | 2025-03-17 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
| CVPR | 2025-03-17 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
| arXiv | 2025-03-14 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
| arXiv | 2025-03-11 | - | Visual/3D/Text ➜Text | ✅ | ❌ |
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
| arXiv | 2025-03-09 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcing Learning
| arXiv | 2025-03-07 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
EgoLife: Towards Egocentric Life Assistant
| CVPR | 2025-03-05 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
| arXiv | 2025-03-03 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Nexus-O: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
| arXiv | 2025-02-26 | | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Megrez-Omni Technical Report
| arXiv | 2025-02-19 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
| ICML | 2025-02-17 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
| WWW | 2025-02-07 | - | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance
| arXiv | 2025-02-06 | - | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Ola: Pushing the Frontiers of Omni-Modal Language Model with Progressive Modality Alignment
| arXiv | 2025-02-06 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
| arXiv | 2025-01-30 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
| arXiv | 2025-01-25 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
MiniCPM-o 2.6: A GPT-4o Level MLLM for Vision, Speech, and Multimodal Live Streaming on Your Phone
| blog | 2025-01-24 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
| arXiv | 2025-01-16 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
OpenOmni: A Fully Open-Source Omni Large Language Model with Real-time Self-Aware Emotional Speech Synthesis
| arXiv | 2025-01-09 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
| arXiv | 2024-12-23 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
| arXiv | 2024-12-20 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
| arXiv | 2024-12-12 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
| arXiv | 2024-12-09 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
| CVPR | 2024-11-29 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
| arXiv | 2024-11-25 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Spider: Any-to-Many Multimodal LLM
| arXiv | 2024-11-14 | - | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Towards Multi-Modal Mastery: A 4.5B Parameter Truly Multi-Modal Small Language Model
| arXiv | 2024-11-08 | - | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
CAD-MLLM: Unifying Multimodality-ConditionedCAD Generation With MLLM
| arXiv | 2024-11-07 | Github | Visual/3D/Text ➜Text/3D | ✅ | ✅ |
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
| NeurIPS | 2024-10-26 | Github | Visual/Audio/3D/Depth/Text ➜Text | ✅ | ❌ |
OMCAT Omni Context Aware Transformer
| arXiv | 2024-10-15 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
| NeurIPS | 2024-10-15 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Aligned Better, Listen Better For Audio-Visual Large Language Models
| ICLR | 2024-10-13 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
Baichuan-Omni Technical Report
| arXiv | 2024-10-11 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Efficient Generative Multimodal Integration (EGMI): Enabling Audio Generation from Text-Image Pairs through Alignment with Large Language Models
| NeurIPS Workshop | 2024-10-11 | - | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
| arXiv | 2024-10-09 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
Large Language Models Are Strong Audio-Visual Speech Recognition Learners
| ICASSP | 2024-09-18 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
VITA: Towards Open-Source Interactive Omni Multimodal LLM
| arXiv | 2024-08-05 | Github | Visual/Audio/Text ➜Text/Audio | ✅ | ✅ |
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
| arXiv | 2024-08-03 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
InternOmni: Extending InternVL with Audio Modality
| blog | 2024-07-31 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
| arXiv | 2024-07-01 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
| arXiv | 2024-06-22 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
| NIPS | 2024-06-17 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
VideoLLaMA 2 Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
| arXiv | 2024-06-11 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
| ACL | 2024-06-06 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
X-VILA: Cross-Modality Alignment for Large Language Model
| arXiv | 2024-05-29 | - | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
| TPAMI | 2024-05-18 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Querying as Prompt: Parameter-Efficient Learning for Multimodal Language Model
| CVPR | 2024-05-06 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
WorldGPT: Empowering LLM as Multimodal World Model
| AAAI | 2024-04-28 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
| arXiv | 2024-03-24 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
CAT : Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
| ECCV | 2024-03-04 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Model Composition for Multimodal Large Language Models
| ACL | 2024-02-18 | Github | Visual/Audio/3D/Text ➜Text | ✅ | ❌ |
GroundingGPT: Language Enhanced Multi-modal Grounding Model
| ACL | 2024-02-11 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning
| ECCV | 2024-01-19 | Github | Visual/Audio/Text ➜Text/Visual | ✅ | ✅ |
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
| CVPR | 2024-01-16 | Github | Visual/3D/Touch/Text ➜Text | ✅ | ❌ |
ModaVerse: Efficiently Transforming Modalities with LLMs
| CVPR | 2024-01-12 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Actions
| CVPR | 2023-12-28 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
M3DBench: Towards Omni 3D Assistant with Interleaved Multi-modal Instructions
| ECCV | 2023-12-17 | Github | Visual/3D/Text ➜Text | ✅ | ❌ |
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
| arXiv | 2023-12-14 | Github | Visual/3D/Text ➜Text | ✅ | ❌ |
Audio-Visual LLM for Video Understanding
| arXiv | 2023-12-11 | - | Visual/Audio/Text ➜Text | ✅ | ❌ |
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
| ECCV | 2023-11-30 | Github | Visual/Audio/3D/Text ➜Text | ✅ | ❌ |
Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE
| ICLR | 2023-11-05 | Github | Visual/3D/Text ➜Text | ✅ | ❌ |
Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
| arXiv | 2023-10-09 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
| EMNLP industry | 2023-09-27 | Github | Visual/Audio/IMU/Text ➜Text | ✅ | ❌ |
NExT-GPT: Any-to-Any Multimodal LLM
| ICML | 2023-09-11 | Github | Visual/Audio/Text ➜Text/Visual/Audio | ✅ | ✅ |
BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs
| arXiv | 2023-07-17 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration
| arXiv | 2023-06-15 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark
| NerIPS | 2023-06-13 | Github | Visual/3D/Text ➜Text | ✅ | ❌ |
Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
| EMNLP demo | 2023-06-05 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst
| arXiv | 2023-05-25 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages
| arXiv | 2023-05-07 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |
eP-ALM: Efficient Perceptual Augmentation of Language Models
| ICCV | 2023-03-20 | Github | Visual/Audio/Text ➜Text | ✅ | ❌ |