GD-ML/UniVG-R1-data

Dataset

UniVG-R1 Model Card

4

8 commits

1 linked in READMEs

updated May 27, 2025

See the code

README

UniVG-R1 Model Card

Model details

We propose UniVG-R1, a reasoning-guided MLLM for universal visual grounding, which leverages reinforcement learning to enhance reasoning across complex multi-image and multi-modal scenarios.

Dataset details

We provide three JSON files as follows:

  1. revised_MIG_bench.json: which contains our revised version of the MIG_bench.
  2. stage1_cotsft.json: which contains the CoT-SFT data required for stage 1.
  3. stage2_rl.json: which contains the RL data required for stage 2.
  4. zero_shot_evaluation: which contains the bounding boxes annotations for zero-shot evaluation.
Multimodal Large Language Model (MLLM)
Reinforcement Fine-tuning
Visual Grounding

Contributors

SuleBai

8 commits

GD-ML/UniVG-R1-data

Dataset

UniVG-R1 Model Card

4

8 commits

1 linked in READMEs

updated May 27, 2025

See the code

README

UniVG-R1 Model Card

Model details

We propose UniVG-R1, a reasoning-guided MLLM for universal visual grounding, which leverages reinforcement learning to enhance reasoning across complex multi-image and multi-modal scenarios.

Dataset details

We provide three JSON files as follows:

  1. revised_MIG_bench.json: which contains our revised version of the MIG_bench.
  2. stage1_cotsft.json: which contains the CoT-SFT data required for stage 1.
  3. stage2_rl.json: which contains the RL data required for stage 2.
  4. zero_shot_evaluation: which contains the bounding boxes annotations for zero-shot evaluation.
Multimodal Large Language Model (MLLM)
Reinforcement Fine-tuning
Visual Grounding

Contributors

SuleBai

8 commits