ligeng0197/Awesome-Thinking-With-Images

Latest open-source "Thinking with images" (O3/O4-mini) papers, covering training-free, SFT-based, and RL-enhanced methods for "fine-grained visual understanding".

114

15 commits

updated Aug 21, 2025

See the code

README

Awesome-Thinking-With-Images

A curated list of research methods and datasets exploring image thinking — the ability to perform reasoning with images. We focus particularly on methods and benchmarks designed for fine-grained visual understanding tasks, which refers to problems with Dense, Cluttered, Complex Visual Input, but only Tiny, Subtle, Ambiguous Visual Regions Subsets are useful for answering.

This includes:

  • Multimodal reasoning with visual context
  • Visual chain-of-thought prompting
  • Dynamic visual attention / focus adjustment
  • Vision-language models with interpretable intermediate states

Feel free to contribute! Pull requests and issues recommendation are welcome.


📚 Awesome Papers

🔹 Training-Free / No-Training Methods


🔹 Supervised Fine-tuning Methods


🔹 RL-Enhanced Methods


🔹 SFT-RL Hybrid Methods

PaperVenueDateResources
Star
Thyme: Think Beyond Images
arXiv2025-08GitHub

🎯 Domain Application

🏥 Medical Domain

🤖 GUI Robot


🧪 Benchmarks & Datasets

DatasetTaskResources
V*Attribute Recognition & Spatial ReasoningHuggingFace
HR-BenchFine-grained Single/Cross-instance PerceptionHuggingFace
MME-RealWorldHigh-Resolution Real-World ScenariosHuggingFace
TreeBenchVisual Grounded ReasoningGitHub
OCR-ReasoningText-Rich Image ReasoningGitHub

🤝 Contributing

If you know any relevant papers, datasets, or demos, feel free to submit a pull request or leava an issue!


Contributors

ligeng0197

15 commits

ligeng0197/Awesome-Thinking-With-Images

Latest open-source "Thinking with images" (O3/O4-mini) papers, covering training-free, SFT-based, and RL-enhanced methods for "fine-grained visual understanding".

114

15 commits

updated Aug 21, 2025

See the code

README

Awesome-Thinking-With-Images

A curated list of research methods and datasets exploring image thinking — the ability to perform reasoning with images. We focus particularly on methods and benchmarks designed for fine-grained visual understanding tasks, which refers to problems with Dense, Cluttered, Complex Visual Input, but only Tiny, Subtle, Ambiguous Visual Regions Subsets are useful for answering.

This includes:

  • Multimodal reasoning with visual context
  • Visual chain-of-thought prompting
  • Dynamic visual attention / focus adjustment
  • Vision-language models with interpretable intermediate states

Feel free to contribute! Pull requests and issues recommendation are welcome.


📚 Awesome Papers

🔹 Training-Free / No-Training Methods


🔹 Supervised Fine-tuning Methods


🔹 RL-Enhanced Methods


🔹 SFT-RL Hybrid Methods

PaperVenueDateResources
Star
Thyme: Think Beyond Images
arXiv2025-08GitHub

🎯 Domain Application

🏥 Medical Domain

🤖 GUI Robot


🧪 Benchmarks & Datasets

DatasetTaskResources
V*Attribute Recognition & Spatial ReasoningHuggingFace
HR-BenchFine-grained Single/Cross-instance PerceptionHuggingFace
MME-RealWorldHigh-Resolution Real-World ScenariosHuggingFace
TreeBenchVisual Grounded ReasoningGitHub
OCR-ReasoningText-Rich Image ReasoningGitHub

🤝 Contributing

If you know any relevant papers, datasets, or demos, feel free to submit a pull request or leava an issue!


Contributors

ligeng0197

15 commits