Amshaker/Mobile-O-SFT

Dataset

5

stars

26

commits

1

linked in READMEs

Feb 24, 2026

updated

mobile-o
multimodal
supervised-fine-tuning

README

Mobile-O SFT Data

Supervised Fine-Tuning Β· ~105K Curated Prompt-Image Pairs

arXiv Code Project Page Models Live Demo

πŸ“Œ Overview

This dataset is used for Stage 2: Supervised Fine-Tuning (SFT) of Mobile-O, a unified multimodal model for on-device understanding and generation.

The goal of this stage is to improve image generation quality by fine-tuning on high-quality curated prompt-image pairs.

πŸ“Š Dataset Composition

SourceSamplesDescription
BLIP3o60KHigh-quality prompt-image pairs
ShareGPT-4o-Image45KCurated image generation pairs
Total~105K

πŸ‹οΈ Training Details

  • Stage: 2 β€” Supervised Fine-Tuning (SFT)
  • Trainable components: DiT + Mobile Conditioning Projector (MCP)
  • Frozen components: Visual encoders, LLM backbone, VAE
ResourceLink
πŸ“„ PaperarXiv
πŸ’» CodeGitHub
πŸ€— Pre-Training DataMobile-O-Pre-Train
πŸ€— Post-Training DataMobile-O-Post-Train
πŸ€— Model (0.5B)Mobile-O-0.5B
πŸ€— Model (1.5B)Mobile-O-1.5B

πŸ“„ Citation

@article{shaker2026mobileo,
  title={Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device},
  author={Shaker, Abdelrahman and Heakl, Ahmed and Muhammad, Jaseel and Thawkar, Ritesh and Thawakar, Omkar and Li, Senmao and Cholakkal, Hisham and Reid, Ian and Xing, Eric P. and Khan, Salman and Khan, Fahad Shahbaz},
  journal={arXiv preprint arXiv:2602.20161},
  year={2026}
}

βš–οΈ License

This dataset is released under CC BY-NC 4.0. For research purposes only.

Contributors

Amshaker

26 commits

Amshaker/Mobile-O-SFT

Dataset

5

stars

26

commits

1

linked in READMEs

Feb 24, 2026

updated

mobile-o
multimodal
supervised-fine-tuning

README

Mobile-O SFT Data

Supervised Fine-Tuning Β· ~105K Curated Prompt-Image Pairs

arXiv Code Project Page Models Live Demo

πŸ“Œ Overview

This dataset is used for Stage 2: Supervised Fine-Tuning (SFT) of Mobile-O, a unified multimodal model for on-device understanding and generation.

The goal of this stage is to improve image generation quality by fine-tuning on high-quality curated prompt-image pairs.

πŸ“Š Dataset Composition

SourceSamplesDescription
BLIP3o60KHigh-quality prompt-image pairs
ShareGPT-4o-Image45KCurated image generation pairs
Total~105K

πŸ‹οΈ Training Details

  • Stage: 2 β€” Supervised Fine-Tuning (SFT)
  • Trainable components: DiT + Mobile Conditioning Projector (MCP)
  • Frozen components: Visual encoders, LLM backbone, VAE
ResourceLink
πŸ“„ PaperarXiv
πŸ’» CodeGitHub
πŸ€— Pre-Training DataMobile-O-Pre-Train
πŸ€— Post-Training DataMobile-O-Post-Train
πŸ€— Model (0.5B)Mobile-O-0.5B
πŸ€— Model (1.5B)Mobile-O-1.5B

πŸ“„ Citation

@article{shaker2026mobileo,
  title={Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device},
  author={Shaker, Abdelrahman and Heakl, Ahmed and Muhammad, Jaseel and Thawkar, Ritesh and Thawakar, Omkar and Li, Senmao and Cholakkal, Hisham and Reid, Ian and Xing, Eric P. and Khan, Salman and Khan, Fahad Shahbaz},
  journal={arXiv preprint arXiv:2602.20161},
  year={2026}
}

βš–οΈ License

This dataset is released under CC BY-NC 4.0. For research purposes only.

Contributors

Amshaker

26 commits