Yuliang-Liu/AWESOME-OCR-LLM

OCR in the Era of Large Language Models

722

189 commits

updated Sep 22, 2026

See the code

README

๐Ÿ”ญ Daily Papers (2026-09-22)

Document Understanding

VenueNamePrimary affiliationTitleGitHubDate
PaperChart-RVRUniversity of VirginiaMonitorable Chart Reasoning Agents via Verifiable Process RewardsHuggingFace GitHub StarsSep. 2026

Chart-RVR โ€” A reinforcement learning framework that trains chart reasoning agents with verifiable process rewards, decomposing reasoning into auditable structure, evidence-table and derivation blocks instead of answer-only outputs.

Visual Text Generation

VenueNamePrimary affiliationTitleGitHubDate
PaperDuetGenUSTCPlanning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation-Sep. 2026

DuetGen โ€” An autonomous visual text generator that jointly learns autoregressive layout planning and diffusion rendering so that rendering supervision shapes the planner's representations instead of optimizing the two stages separately.

๐Ÿ“– Contents

Overview

A curated, continuously updated reading list of OCR in the era of large language models, covering document parsing and understanding, visual text generation, benchmarks, challenges, and future perspectives, with a focus on research around the past five years (2021โ€“now).

Scope. This list tracks OCR in the LLM era: work that applies large vision-language or multimodal models to text-rich images and documents (parsing, understanding, benchmarks, and specialized text tasks). It is not a general document-AI list, a generic MLLM list, or a classical OCR-1.0 list; such work appears only when it directly bears on text-rich visual understanding.

A note on evaluation. Most recent systems are released as technical reports with self-reported numbers, private test sets, and inconsistent protocols, so cross-paper scores are rarely comparable in a rigorous sense. We list results as reported and, where known, indicate the evaluation basis. The field still lacks a unified, contamination-resistant, reproducible benchmark, and we see building one as a prerequisite for trustworthy leaderboard claims.

๐ŸŽ‰ News

  • [2026-2-11] ๐Ÿ”ฅ We release an open-source resource to help the community easily track recent OCR research!

Contributing. PRs welcome. One row per model, newest first; please include venue/date, affiliation, and a code or model link.

Emerging Trends (2023โ€“2026)

  • End-to-end VLM-based parsing replaces modular OCR pipelines.
  • Reinforcement learning for layout and reading order modeling.
  • OCR-free document understanding models.
  • Scaling down: compact document VLMs under 1B parameters.
  • Long-doc OCR is a scaling problem of tokens and consistency, not just context length.
  • Structure (layout + logic) is the new accuracy.
  • Generative OCR shifts the core risk from โ€œmisrecognitionโ€ to โ€œhallucinationโ€.
  • Benchmarks are moving toward executable evaluation.
  • Document agents and autonomous reasoning over PDFs.
  • Document Agents need recoverability, not one-shot perfection.

๐Ÿ“„ Document Parsing

Document parsing focuses on converting visually complex documents into structured, machine-readable representations. In the LLM era, parsing is no longer a pipeline of isolated modules, but increasingly unified within end-to-end VLM architectures.

VenueNamePrimary affiliationTitleGitHubDate
PrismAlignHuaweiPrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR-Sep. 2026
PaperWeVisDocTencentWeVisDoc: From Coverage to Capability for Robust End-to-End Document ParsingHuggingFace GitHub StarsSep. 2026
PaperJina-OCR-v1Jina AIJina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable RewardsHuggingFaceSep. 2026
PaperOCR-EDRTencentOCR-EDR: Rendering-Aware Diagnosis and Repair for Closed-Loop OCR Improvement-Sep. 2026
PaperWayu-Paxa-OCR-ZeroWayu ResearchHow Far Can Synthetic Data Take Thai OCR?-Sep. 2026
PaperSCVERFudan UniversityState-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models-Sep. 2026
PaperFinixDocAnt GroupFinixDoc: Rethinking Financial Document Parsing Beyond Saturated BenchmarksHuggingFaceAug. 2026
SmolDocling-KV-LinkIBMIdentify, Locate, Link: End-to-End Key-Value Extraction from Document Images-Aug. 2026
PaperArmorOCRAnt GroupArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-DistillationGitHub StarsAug. 2026
PaperNaviDC-OCRChina Telecom AINaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents-Aug. 2026
PaperTongGuOCRSCUTTongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical DocumentsGitHub StarsAug. 2026
PaperPaDocTsinghua UniversityPaDoc: Layout-Grounded Parallel Decoding for Document ParsingGitHub StarsAug. 2026
Logographic PretrainingQMULLogographic Character Visual Pretraining via Semantic-based Contrastive Learning-Aug. 2026
SPIRALSEUSame Semantics, Different Paths: Self-Improving Alignment for Vision-Text CompressionGitHub StarsAug. 2026
DocPOTencentDocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards-Aug. 2026
PaperDrawAIBUPTDrawAI: Agentic Benchmark and Workflow for Making Raster Images EditableHuggingFace GitHub StarsAug. 2026
PaperLayoutLiteYuanli TechnologyLayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCRGitHub StarsJul. 2026
PaperHPD-ParsingBaiduHPD-Parsing: Hierarchical Parallel Document ParsingHuggingFace GitHub StarsJul. 2026
PaperOvisOCR2AlibabaOvisOCR2 Technical ReportHuggingFace GitHub StarsJul. 2026
PaperDocOCR-EvalUniversity of MelbourneDocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth-Jul. 2026
PaperMonkeyOCRv2HUST&KingsoftMonkeyOCRv2: A Visual-Text Foundation Model for Document AIHugging Face GitHub StarsJul. 2026
PaperInfinity-Parser2INF TeamInfinity-Parser2 Technical ReportHugging FaceGitHub StarsJul. 2026
PaperHunyuanOCR-1.5TencentHunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and BetterHuggingFace Stars GitHub StarsJul. 2026
PaperSAYREAlibabaEnhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis-Jul. 2026
PaperP-MTPBaiduP-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling-Jun. 2026
PaperRT-DocLayoutBaiduRT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild-Jun. 2026
PaperUnlimited-OCRBaiduUnlimited OCR WorksGitHub StarsJun. 2026
PaperBeaverMicrosoft ResearchBuilding Agent Harnesses for Scientific Curation from Multimodal Sources-Jun. 2026
PaperAgents-K1Shanghai AI LaboratoryAgents-K1: Towards Agent-native Knowledge OrchestrationHuggingFace StarsJun. 2026
PaperPaddleOCR-VL-1.6BaiduPaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-TrainingGitHub StarsJun. 2026
PaperPP-OCRv6BaiduPP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR TasksGitHub StarsJun. 2026
StrucTabIIE, CASStrucTab: A Structured Optimization Framework for Table ParsingGitHub StarsJun. 2026
PaperExChartZhejiang UniversityMaking Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework-Jun. 2026
PaperMinerU-PopoShanghai AI Laboratory & OpenDataLabMinerU-Popo: Universal Post-Processing Model for Structured Document ParsingGitHub StarsMay. 2026
RTPruneDeepSeekRTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR InferenceGitHub StarsMay. 2026
PaperABot-OCRAlibabaABot-OCR Technical ReportGitHub StarsMay. 2026
PaperBabelDOCfunstory.aiBabelDOC: Better Layout-Preserving PDF Translation via Intermediate RepresentationGitHub StarsMay. 2026
PaperConsensus EntropyFudan UniversityConsensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCRGitHub StarsMay. 2026
PaperFastOCRTsinghua University & JDFastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing-May. 2026
PaperMinerU2.5-ProShanghai AI LaboratoryMinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at ScaleGitHub StarsApr. 2026
PaperPixelPruneOPPOPixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive CodingGitHub StarsApr. 2026
PaperTexOCRYale University & Zhejiang UniversityTexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX ReconstructionGitHub StarsApr. 2026
PaperFalcon OCRFalcon Vision Team, TIIFalcon PerceptionGitHub StarsMar. 2026
PaperMinerU-DiffusionShanghai AI LaboratoryMinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion DecodingGitHub StarsMar. 2026
PaperQianfan-OCRBaiduQianfan-OCR: A Unified End-to-End Model for Document IntelligenceGitHub StarsMar. 2026
Paperdots.mocrHUSTMultimodal OCR: Parse Anything from DocumentsGitHub StarsMar. 2026
PaperFireRed-OCRXiaohongshu IncFireRed-OCR Technical ReportGitHub StarsMar. 2026
PaperAgenticOCRShanghai AI Laboratory & OpenDataLabAgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented GenerationGitHub StarsMar. 2026
PTPTencentEfficient Document Parsing via Parallel Token Prediction-Mar. 2026
PaperLogics-Parsing-OmniAlibabaLogics-Parsing-Omni Technical ReportGitHub StarsMar. 2026

๐Ÿ“„ See full list at Document-Parsing.md

๐Ÿ“„ Document Understanding

Document understanding extends beyond structural parsing to semantic comprehension and reasoning over visually rich documents.

VenueNamePrimary affiliationTitleGitHubDate
PaperChart-RVRUniversity of VirginiaMonitorable Chart Reasoning Agents via Verifiable Process RewardsHuggingFace GitHub StarsSep. 2026
PaperViSARINSA LyonViSAR: Training-Free Adaptive-k Retrieval for Visual Document Question Answering-Sep. 2026
PaperDocIntentSCUTDocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering-Sep. 2026
Doc-REFRAGZhejiang UniversityDoc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented GenerationGitHub StarsSep. 2026
AWMUniversity of OsloAWM: Answerable Working Memory for Long-Document VQA AgentsGitHub StarsAug. 2026
PaperSAGEFudan UniversitySAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding-Aug. 2026
PaperQ-GuideAmazonQuestion-Guided Evidence Acquisition for Multimodal Visual Question Answering-Aug. 2026
PaperDocClawNTUDocClaw: A Unified Agentic System for Intelligent Document ProcessingGitHub StarsAug. 2026
PaperConceptFormerNortheastern UniversityConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document RetrievalGitHub StarsAug. 2026
Hyper-M2RAGHangzhou Dianzi UniversityHypergraph-based Multimodal Retrieval-Augmented Generation with Incremental RefinementGitHub StarsAug. 2026
PaperTridentEmory UniversityWhat the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering-Aug. 2026
PaperD2-ScaleAgentZhejiang UniversityD2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding-Aug. 2026
SEERUT AustinSEER: Long-Context Reasoning via Selective Visual-Text CompressionGitHub StarsAug. 2026
PaperHAM-RAGHKUSTHAM-RAG: Hierarchy-Aware Multimodal RAG for Structure-Faithful Interleaved GenerationGitHub StarsAug. 2026
DRUFShenzhen MSU-BIT UniversityBeyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMsGitHub StarsAug. 2026
PaperDistilVDRAalto UniversityDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationGitHub StarsAug. 2026
PaperInSight-docHKUSTInSight-doc: Agentic Visual Perception for Long-Document UnderstandingGitHub StarsAug. 2026
PaperDocAtlasWuhan University / MicrosoftDocAtlas: Long-Document Understanding as Mutable-State Interaction-Aug. 2026
PaperDocMemoHIT, ShenzhenDocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document UnderstandingGitHub StarsAug. 2026
PaperECFBeihang UniversityDoes More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?GitHub StarsAug. 2026
PaperADOPD 2026Georgia TechThinking with Anchors: Grounded and Efficient Document ReasoningHuggingFace GitHub StarsAug. 2026
PaperVTSMBZUAIWhen Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning-Aug. 2026
PaperQ-CueGraphThe University of TokyoQ-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning-Aug. 2026
PaperDocTraceBaiduDocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning-Aug. 2026
PaperCURVWilliam & MaryCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning-Aug. 2026
PaperRAGOCRPeking UniversityRAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation-Aug. 2026
PaperVaRS-DocSJTUVaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document RetrievalGitHub StarsAug. 2026
PaperET-PruneSJTUET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsGitHub StarsAug. 2026
PaperHierDocUSTCHierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering-Aug. 2026
DualG-MRAGBUAADualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation-Jul. 2026
PaperMMLDSum-LLMOPPOMMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware-Jul. 2026
PaperTAP-RAGTianjin UniversityTAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question AnsweringAnonymous CodeJul. 2026
Perception-RFTQuantiphiStop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment-Jul. 2026
CMDRNTTCMDR: Contextual Multimodal Document RetrievalHuggingFace Stars GitHub StarsJul. 2026
PaperHiEvi-RAGUSTCHierarchical Evidence-Driven Reasoning for Long Document Understanding-Jul. 2026
PaperMultAttnAttribโ€”MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering-Jul. 2026
PaperOracleAnalyserNUDTOracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training-Jun. 2026
PaperDocArenaAdobe ResearchDocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents-Jun. 2026
ViTexQAMeituanViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question AnsweringGitHub Stars HuggingFace DatasetJun. 2026
PaperPreciseDocTsinghua UniversityAn LMM for Precisely Grounding Elements in Documents-Jun. 2026
LightSTARSJTULightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive RefinementGitHub StarsJun. 2026
PaperSciLensHKUSTSciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding-Jun. 2026
PaperSAFE-CascadeWalmartSAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering-Jun. 2026
PaperUMG-RAGPurdue UniversityUncertainty-Aware Hybrid Retrieval for Long-Document RAG-Jun. 2026
PaperMAGE-RAGBITMAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QAGitHub StarsJun. 2026
PaperMINARDUniversity of MarylandHelping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures-Jun. 2026
PaperMM-BizRAGJPMorgan Chase & Co.MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A-Jun. 2026
PaperKG4VDNational Taiwan UniversityMultimodal Graph RAG for Long-range Visually Rich Document UnderstandingGitHub StarsJun. 2026
ZipRerankMagellan Technology Research InstituteVery Efficient Listwise Multimodal Reranking for Long DocumentsGitHub StarsMay. 2026
PaperGeoSym127KSenseTime Research & CUHK ShenzhenGeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric ReasoningGitHub StarsMay. 2026

๐Ÿ“„ See full list at Document-Understanding.md

๐Ÿ“„ Visual Text Generation

Visual Text Generation focuses on generating or editing legible, visually harmonious, and semantically consistent text within images, serving as the creative inverse of OCR. In the LLM era, it is no longer a task reliant on specialized modules, but is emerging as a foundational skill for general-purpose generative models.

VenueNamePrimary affiliationTitleGitHubDate
PaperDuetGenUSTCPlanning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation-Sep. 2026
LoGANNetflixLoGAN: Multilingual Font Localization with Generative Agents-Sep. 2026
PaperGlyphAnchorFudan UniversityGlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph Priors-Sep. 2026
PaperTextRefineKuaishouTextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters-Aug. 2026
PaperPosterTextWuhan UniversityPosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster-Aug. 2026
PaperTransAnyTextWuhan UniversityTransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation-Aug. 2026
onoffGISTBridging Online and Offline Handwriting via Differentiable Physical RenderingGitHub StarsAug. 2026
PaperPosterMELDTsinghua UniversityPosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready OutputsGitHub StarsAug. 2026
InnoTextSYSUInnoText: A Unified Model for Visual Text Generation and Editing-Jul. 2026
PaperBoogu-Image-0.1Boogu Team,HuaweiBoogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationHuggingFace GitHub StarsJul. 2026
PaperSciFormaMicrosoft & Peking UniversitySciForma: Structure-Faithful Generation of Scientific DiagramsGitHub StarsJul. 2026
PaperVecFontLLMFuzhou University & Peking UniversityVecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts-Jul. 2026
PaperArtChartAnt GroupArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering-Jul. 2026
PaperDataEvolverCSUDataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image GenerationGitHub StarsJul. 2026
PaperQwen-Image-2.0-RLAlibabaQwen-Image-2.0-RL Technical Report-Jun. 2026
UniTranslatorIIE CASUniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine TranslationGitHub StarsJun. 2026
PaperSteerVTEByteDance & Peking UniversitySteerVTE: Seamless Video Text Editing with Style and Glyph Control-Jun. 2026
PaperDiffMathSCUT & HuaweiDiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression GenerationGitHub StarsJun. 2026
PaperPhyDrawGenUniversity of DhakaPhyDrawGen: Physically Grounded Diagram Generation from Natural Language-Jun. 2026
PaperNIVReichman UniversityNIV: Neural Axis Variations for Variable Font GenerationGitHub StarsJun. 2026
PaperQwen-Image-2.0Alibaba GroupQwen-Image-2.0 Technical ReportGitHub StarsMay. 2026
PaperMangaFlowThe University of TokyoMangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation-May. 2026
PaperWan-ImageAlibaba GroupWan-Image: Pushing the Boundaries of Generative Visual Intelligence-Apr. 2026
PosterIQPolyUPosterIQ: A Design Perspective Benchmark for Poster Understanding and GenerationGitHub StarsMar. 2026
PaperEfficientPosterGenTsinghua UniversityEfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation DetectionGitHub StarsMar. 2026
PaperTextFlowNJUSTTowards Training-Free Scene Text EditingGitHub StarsMar. 2026
PaperGlyphPrinterFudan UniversityGlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text RenderingGitHub StarsMar. 2026
PaperCTRL-SSJTUReliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning-Mar. 2026
PaperLaDeAdobe ResearchLaDe: Unified Multi-Layered Graphic Media Generation and Decomposition-Mar. 2026
PaperEchoGenUSTCEchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding-Mar. 2026
PaperWebVRStepFunWebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics-Mar. 2026
PaperAutoFigure-EditWestlake UniversityAutoFigure-Edit: Generating Editable Scientific IllustrationGitHub StarsMar. 2026
PaperGlyphBananaSJTU & Xiaohongshu Inc.GlyphBanana: Advancing Precise Text Rendering Through Agentic WorkflowsGitHub StarsMar. 2026
PaperInnoAds-ComposerJD.comInnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation-Mar. 2026
PaperSeeing is ImprovingUSTCSeeing is Improving: Visual Feedback for Iterative Text Layout RefinementGitHub StarsMar. 2026
PosterOmniHKUST(GZ)PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward FeedbackGitHub StarsFeb. 2026
TextPeckerHUSTTextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text RenderingGitHub StarsFeb. 2026
PaperSSPTTongji UniversitySpace Syntax-guided Post-training for Residential Floor Plan Generation-Feb. 2026
PaperChatUMMTsinghua University & Tencent HunyuanChatUMM: Robust Context Tracking for Conversational Interleaved Generation-Feb. 2026
PosterVerseSCUTPosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable TypographyGitHub StarsJan. 2026
-GPT-Image-1.5OpenAIGPT-Image-1.5---Dec. 2025
-Gemini 3 Pro ImageGoogle DeepMindGemini 3 Pro Image (Nano Banana Pro)---Nov. 2025
-Gemini 2.5 Flash ImageGoogle DeepMindGemini 2.5 Flash Image (Nano Banana)---Oct. 2025
PaperQwen-ImageQwen TeamQwen-Image Technical ReportGitHub StarsSep. 2025
PaperSeedream 4.0ByteDance SeedSeedream 4.0: Toward Next-generation Multimodal Image Generation---Aug. 2025
PaperPostergenStony Brook UniversityPostergen: Aesthetic-aware paper-to-poster generation via multi-agent llmsGitHub StarsAug. 2025
UniGlyphTsinghua UniversityUniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis---Jul. 2025
PaperX-OmniTencent Hunyuan XX-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great AgainGitHub StarsJul. 2025
Paper DreamPosterIntelligent Creation Lab, ByteDanceDreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design---Jul. 2025
PosterCraftHKUST(GZ)PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified FrameworkGitHub StarsJun. 2025

๐Ÿ“„ See full list at Visual-Text-Generation.md

๐Ÿ“„ Specialized Model

Beyond general document parsing and understanding, traditional OCR research remains essential for specialized visual-text structures, restoration, temporal analysis, and forensic reliability.

๐Ÿ“„ Document Dewarping

Document dewarping restores photographed or scanned pages to a geometrically rectified and readable form.

VenueNamePrimary affiliationTitleGitHubDate
PaperBookNetHFUTBookNet: Dual-Page Book Image Rectification via Cross-Page Attention-Jan. 2026
PaperTADocCASTADoc: Robust Time-Aware Document Image Dewarping-Aug. 2025
PaperDocDewarpHVHITDual Dimensions Geometric Representation Learning Based Document DewarpingGitHub StarsJul. 2025
DocMatcherFZI & KITDocMatcher: Document Image Dewarping via Structural and Textual Line MatchingGitHub StarsMar. 2025
Paper-Shuya Branch of the Ivanovo State UniversityEfficient Document Image Dewarping via Hybrid Deep Learning and Cubic Polynomial Geometry RestorationGitHub StarsJan. 2025
DocScannerUSTCDocScanner: Robust Document Image Rectification with Progressive LearningGitHub StarsJan. 2025
DocResSCUTDocRes: A Generalist Model Toward Unifying Document Image Restoration TasksGitHub StarsJun. 2024
DocNLCSCUTDocNLC: A Document Image Enhancement Framework with Normalized and Latent Contrastive Representation for Multiple DegradationsGitHub StarsFeb. 2024
DocTr++USTCDeep Unrestricted Document Image Rectification-2024
LA-DocFlattenCASLayout-aware Single-image Document FlatteningGitHub Stars2024
UVDocETH ZurichUVDoc: Neural Grid-based Document UnwarpingGitHub StarsOct. 2023
Foreground and Text-lines Aware ModelHIT Shenzhen, ChinaForeground and text-lines aware document image rectificationGitHub StarsJun. 2023
DocMAEUSTC & iFLYTEKDocMAE: Document Image Rectification via Self-supervised Representation Learning-2023
MariorSCUT & IntSigMarior: Margin Removal and Iterative Content Rectification for Document Dewarping in the WildGitHub StarsOct. 2022

๐Ÿ“„ Physical Structure Analysis

Physical structure analysis identifies document regions, layouts, and spatial relationships before semantic reasoning.

VenueNamePrimary affiliationTitleGitHubDate
PaperPorTEXTONOVA School of Science and TechnologyPorTEXTO: A European Portuguese Benchmark for Visual Text Extraction-Jun. 2026
Paper-Insiders Technologies GmbHBounding Box Label Propagation for Re-Annotation of Document Layout Analysis Datasets-Jun. 2026
PaperIndustryBench-MIPUMultimodal and Industrial AI Team, AlibabaIndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial ProductsGitHub StarsJun. 2026
PaperERN-NetTamkang UniversityERN-Net : Evolving Reason Node-Net for Document Binarization-Jun. 2026
HiLExIEM KolkataHiLEx: Image-Based Hierarchical Layout Extraction from Question PapersGitHub StarsMar. 2025
DCEM-ViTSharda University, Greater Noida, IndiaDevanagari character encoded mix-merge vision transformer for robust document layout analysis---Mar. 2025
Efficient Additive Attention DLATechnical University of Kaiserslautern, GermanyEfficient Additive Attention for Transformer-based Semi-supervised Document Layout Analysis---Feb. 2025
DocSemiTechnical University of Kaiserslautern, GermanyDocSemi: Efficient Document Layout Analysis with Guided Queries---Feb. 2025
FS-QCSNetChina University of Mining and TechnologyFew-Shot Quaternion-valued Correlation Squeeze Network for Document Image Layout Segmentation---Jan. 2025
LayoutDETRSalesforce ResearchLayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer-Sep. 2024
LayoutLLMAlibaba GroupLayoutLLM: Layout Instruction Tuning with Large Language Models for Document UnderstandingGitHub StarsJun. 2024
RoDLAKIT & Univ. of OxfordRoDLA: Benchmarking the Robustness of Document Layout Analysis ModelsGitHub StarsJun. 2024
DocLLMJPMorgan Chase & Co.DocLLM: A Layout-Aware Generative Language Model for Multimodal Document UnderstandingGitHub StarsMay 2024
SemiDocSegComputer Vision Center, Barcelona, SpainSemiDocSeg: Harnessing Semi-Supervised Learning for Document Layout Analysis---Mar. 2024
VGTAlibaba GroupVision Grid Transformer for Document Layout AnalysisGitHub StarsOct. 2023
GeoLayoutLMAlibaba GroupGeoLayoutLM: Geometric Pre-training for Visual Information ExtractionGitHub StarsJun. 2023
M6DocSCUTM6Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout AnalysisGitHub StarsJun. 2023
HRDocUSTC & iFLYTEKHRDoc: Dataset and Baseline Method Toward Hierarchical Reconstruction of Document StructuresGitHub StarsFeb. 2023
LayoutLMv3MicrosoftLayoutLMv3: Pre-training for Document AI with Unified Text and Image MaskingGitHub StarsOct. 2022

๐Ÿ“„ Reading Order Prediction

Reading order prediction recovers the intended sequence of text and visual elements in complex page layouts.

VenueNamePrimary affiliationTitleGitHubDate
PaperOrliUniversity of KonstanzEnd-to-End Text Line Detection and OrderingGitHub StarsJun. 2026
PaperFocalOrderUnisound AI Technology Co. Ltd.FocalOrder: Focal Preference Optimization for Reading Order Detection-Jan. 2026
PaperROAPUESTCROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information ExtractionGitHub StarsJan. 2026
PaperXY-cut++Tianjin UniversityXY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark-Apr. 2025
UniHDSAUSTC & Microsoft Research AsiaUniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure AnalysisGitHub Stars2025
HanDoc-OrderOCRNCCU & Academia SinicaReading between the Lines: Image-Based Order Detection in OCR for Chinese Historical Documents-Feb. 2024
Detect-Order-ConstructUSTC & Microsoft Research AsiaDetect-Order-Construct: A Tree Construction Based Approach for Hierarchical Document Structure AnalysisGitHub Stars2024
Reading Order MattersFudan UniversityReading Order Matters: Information Extraction from Visually-rich Documents by Token Path PredictionGitHub StarsDec. 2023
LayoutLMv3SYSULayoutLMv3: Pre-training for Document AI with Unified Text and Image MaskingGitHub StarsOct. 2022

๐Ÿ“„ Mathematical Expression Recognition

Mathematical expression recognition converts printed or handwritten formulas into structured symbolic representations.

VenueNamePrimary affiliationTitleGitHubDate
Paper-University of AlicanteDirect content-based retrieval from music scores images-May. 2026
PaperMusicSynth-MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition-May. 2026
PaperTranscodaHeinrich Heine University DรผsseldorfTranscoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic TrainingGitHub StarsMay. 2026
PaperFrom Image to Music LanguageFindLabFrom Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR-Apr. 2026
UniMERNetOpenDataLab & Shanghai AI LabUniMERNet: A Universal Network for Real-World Mathematical Expression RecognitionGitHub StarsJun. 2025
CDMOpenDataLabImage Over Text: Transforming Formula Recognition Evaluation with Character Detection MatchingGitHub StarsJun. 2025
SSANInner Mongolia UniversitySSAN: A Symbol Spatial-Aware Network for Handwritten Mathematical Expression RecognitionGitHub StarsApr. 2025
TAMERPeking UniversityTAMER: Tree-Aware Transformer for Handwritten Mathematical Expression RecognitionGitHub StarsApr. 2025
JournalVLPGUCASVisionโ€“language pre-training for graph-based handwritten mathematical expression recognitionGitHub StarsJan. 2025
BATUSTC & iFLYTEKBidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression RecognitionGitHub Stars2025
LattEPurdue UniversityLattE: Improving LaTeX Recognition with Iterative RefinementGitHub StarsSep. 2024
-TUAT & VGU & RIT & Nantes Univ.A Survey on Handwritten Mathematical Expression Recognition: The Rise of Encoder-Decoder and GNN Models-Sep. 2024
NAMERUSTC & iFLYTEK ResearchNAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition-Sep. 2024
HMEGHangzhou Dianzi Univ.Generating Handwritten Mathematical Expressions from Symbol Graphs: An End-to-End Pipeline-Jun. 2024
BPDSCUTA Tree-Based Model with Branch Parallel Decoding for Handwritten Mathematical Expression Recognition-2024
SAN (Syntax-Aware Net)Tomorrow Advancing LifeSyntax-Aware Network for Handwritten Mathematical Expression RecognitionGitHub StarsJun. 2022

๐Ÿ“„ Table & Chart Understanding

Table and chart understanding covers structure recognition, data extraction, grounding, retrieval, and visual reasoning over structured graphics.

VenueNamePrimary affiliationTitleGitHubDate
Paper-Teamreboott Inc.Rethinking the Pointer Loss in Table Structure Recognition: Geometry-Aware Pointer Loss for Spatial LocalityGitHub StarsJun. 2026
Paper-Preferred Networks, Inc.Revisiting Structural Dependency in Autoregressive Multi-Task Table Recognition via Order-Independent Cell-Level Representations-Jun. 2026
PaperChartLensShandong UniversityChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary RefinementGitHub StarsJun. 2026
PaperPOTATRKensho Technologies (S&P Global)POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction-Jun. 2026
JournalChartReLAUniversity of Science, Ho Chi Minh city, VietnamChartReLA: A compact vision-language model for comprehensivechart reasoning via relationship modelingGitHub StarsJan. 2026
Table-R1XJTU-Liverpool UniversityCan GRPO Boost Complex Multimodal Table Understanding?-Dec. 2025
TinyChartAlibaba & TsinghuaTinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging-Nov. 2024
ReachQAFudan UniversityDistill Visual Chart Reasoning Ability from LLMs to MLLMsGitHub StarsOct. 2024
OmniParserAlibaba GroupOmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table RecognitionGitHub StarsJun. 2024
DePlotGoogleDePlot: One-shot visual language reasoning by plot-to-table translationGitHub StarsJul. 2023
TableVLMFudan UniversityTableVLM: Multi-modal Pre-training for Table Structure Recognition-Jul. 2023
VASTHuaweiImproving Table Structure Recognition with Visual-Alignment Sequential Coordinate Modeling-Jun. 2023
LOREAlibaba GroupLORE: Logical Location Regression Network for Table Structure RecognitionGitHub StarsFeb. 2023
ChartQAYork UniversityChartQA: A Benchmark for Question Answering about Charts with Visual and Logical ReasoningGitHub StarsJul. 2022
LGPMAHikvisionLGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask AlignmentGitHub StarsSep. 2021

๐Ÿ“„ Scene Text Understanding

Scene text understanding unifies text detection, recognition, and spotting in natural images and related real-world settings.

VenueNamePrimary affiliationTitleGitHubDate
PaperNext-Generation Parallel Decoder for LPDRNUTECHNext-Generation Parallel Decoder for LPDR: Architectural Optimization and Class-Balanced GAN-Augmentation-Jun. 2026
Paper-Polytechnic University of TurinDo You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting-May. 2026
PaperMNSPNankai UniversityMasked Next-Scale Prediction for Self-supervised Scene Text RecognitionGitHub StarsMay. 2026
Paper-Afeka Academic College of EngineeringMapping License Plate Recoverability Under Extreme Viewing Angles for Oppor-tunistic Urban Sensing-Apr. 2026
DPText-DETRWuhan Univ.DPText-DETR: Towards Better Scene Text Detection with Dynamic Points in TransformerGitHub StarsFeb. 2023
DeepSoloWuhan UniversityDeepSolo: Let Transformer Decoder with Explicit Points Solo for Text SpottingGitHub StarsNov. 2022
ABINet++USTCABINet++: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text SpottingGitHub StarsNov. 2022
SwinTextSpotterSCUTSwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text RecognitionGitHub StarsMar. 2022
ABCNet v2SCUTABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text SpottingGitHub StarsMay. 2021
PAN++Nanjing UniversityPAN++: Towards Efficient and Accurate End-to-End Spotting of Arbitrarily-Shaped TextGitHub StarsMay. 2021
MANGOHikvision Research InstituteMANGO: A Mask Attention Guided One-Stage Scene Text SpotterGitHub StarsDec. 2020
Mask TextSpotter v3HUSTMask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text SpottingGitHub StarsJul. 2020
Text perceptronHikvision Research InstituteText perceptron: Towards end-to-end arbitrary-shaped text spottingGitHub StarsApr. 2020
ABCNetSCUTABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve NetworkGitHub StarsFeb. 2020

๐Ÿ“„ Text Removal & Editing

Text removal and editing modifies textual content in images while preserving visual consistency and surrounding appearance.

VenueNamePrimary affiliationTitleGitHubDate
PaperProductConsistencyFractal AnalyticsProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RLGitHub StarsJun. 2026
Paper-Fudan UniversityUnified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification-Jun. 2026
PaperUniDDTNanjing UniversityUniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer-Jun. 2026
PaperTextWandPeking UniversityTextWand: A Unified Framework for Scene Text Editing-Jun. 2026
TMIMUSTCLeveraging Text Localization for Scene Text Removal via Text-Aware Masked Image ModelingGitHub StarsSep. 2024
PowerPaintTsinghua & Shanghai AI LabPowerPaint: A Task is Worth One Word โ€” Learning with Task Prompts for High-Quality Versatile Image InpaintingGitHub StarsSep. 2024
MagicEraserHuaweiย  & SIAT, CASMagicEraser: Erasing Any Objects via Semantics-Aware Control-Sep. 2024
TurboEditAdobeTurboEdit: Instant Text-based Image EditingGitHub StarsSep. 2024
SPDInvHKUSTSource Prompt Disentangled Inversion for Boosting Image EditabilityGitHub StarsSep. 2024
DARLINGUSTCChoose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing-Jun. 2024
SceneTextGenMeta & RutgersLayout-Agnostic Scene Text Image Synthesis with Diffusion Models-Jun. 2024
-KAISTPrompt Augmentation for Self-supervised Text-guided Image Manipulation-Jun. 2024
ViTEraserSCUTViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM PretrainingGitHub StarsFeb. 2024
FETNetKyushu Univ.FETNet: Feature Erasing and Transferring Network for Scene Text RemovalGitHub Stars2023

๐Ÿ“„ Text Image Super-Resolution

Text image super-resolution restores low-resolution text regions while preserving character identity and legibility.

VenueNamePrimary affiliationTitleGitHubDate
PaperFDFAnhui UniversityFrequency Decoupled Framework for Screen Content Image Super-Resolution-Jun. 2026
PaperDTG-RestoreVirginia TechDTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution-Jun. 2026
PaperEverything at Every ScaleMITEverything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution-May. 2026
PaperPRISMSJTUPRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-ResolutionGitHub StarsMay. 2026
TextDiffBUPTTextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution-2025
PEANSoutheast Univ.PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-ResolutionGitHub StarsOct. 2024
DCDMIIT RoorkeeDCDM: Diffusion-Conditioned-Diffusion Model for Scene Text Image Super-ResolutionGitHub StarsSep. 2024
DiffTSRBIT & SenseTimeDiffusion-based Blind Text Image Super-ResolutionGitHub StarsJun. 2024
SGENetFudan Univ. & Videt Tech.SGENet: Efficient Scene Text Image Super-Resolution with Semantic Guidance-Apr. 2024
STIRERTongji Univ. & Fudan Univ.STIRER: A Unified Model for Low-Resolution Scene Text Image Recovery and RecognitionGitHub StarsOct. 2023
DocDiffBUPTDocDiff: Document Enhancement via Residual Diffusion ModelsGitHub StarsOct. 2023
-HIT & NTULearning Generative Structure Prior for Blind Text Image Super-ResolutionGitHub StarsJun. 2023
DPMNSoutheast Univ.DPMN: Improving Scene Text Image Super-Resolution via Dual Prior Modulation NetworkGitHub StarsFeb. 2023
TPGSRHong Kong PolyUText Prior Guided Scene Text Image Super-ResolutionGitHub Stars2023

๐Ÿ“„ Handwritten Document Analysis

Handwritten document analysis covers handwriting recognition, writer-related analysis, signatures, and document-level handwritten content.

VenueNamePrimary affiliationTitleGitHubDate
Paper-LTUPerformance Gap Analysis between Latin and Arabic Scripts HTR-Jun. 2026
PaperPrototypical Signature ApproachETS / LIVIA Lab, Universite du QuebecA Prototypical Signature Approach for Writer-Independent Offline Signature VerificationGitHub StarsJun. 2026
PaperStringalign-Stringalign: Moving beyond summary statistics with a transparent Unicode-aware tool for evaluating automatic transcription models-Jun. 2026
Paper-Offenburg UASIntelligent Character Recognition of Handwritten Forms with Deep Neural Networks-Jun. 2026
MetaWriterConcordia Univ. & MilaMetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning-Jun. 2025
-Univ. of AlicanteOn the Generalization of Handwritten Text Recognition Models-Jun. 2025
DetailSemNetNYCU, TaiwanDetailSemNet: Elevating Signature Verification through Detail-Semantic Integration-Sep. 2024
TransOSVXi'an Jiaotong Univ.TransOSV: Offline Signature Verification with Transformers-2024

๐Ÿ“„ Video Text Analysis

Video text analysis studies temporal text detection, recognition, spotting, tracking, and reasoning across video frames.

VenueNamePrimary affiliationTitleGitHubDate
PaperTraRARIKENTraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban SurveillanceGitHub StarsJun. 2026
PaperBeyond DetectionNankai UniversityBeyond Detection: A Structure-Aware Framework for Scene Text Tracking-May. 2026
PaperVTAgentWuhan UniversityVTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA-May. 2026
VimTSHUSTVimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-Domain GeneralizationGitHub StarsApr. 2025
GoMatchingWuhan Univ. & NTUGoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term MatchingGitHub StarsDec. 2024
TransDeTRZhejiang Univ. & BUPTTransDeTR: End-to-End Video Text Spotting with TransformerGitHub Stars2024
BiRViT-1KCASIAVideo Text Detection With Robust Feature Representation-2024

๐Ÿ“„ Historical Document Analysis

Historical document analysis addresses OCR, restoration, structure recovery, and interpretation for manuscripts and archival materials.

VenueNamePrimary affiliationTitleGitHubDate
AlphaOracleHUSTAlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learningGitHub StarsJul. 2026
PaperUrdu Katib Handwritten DatasetUniversity of Gujrat, PakistanUrdu Katib Handwritten Dataset: A Historical Document Dataset for Offline Urdu Handwritten Text Recognition with CRNN-Based Baseline Evaluation-Jun. 2026
Paper-UMRE, ItalyA Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts-Jun. 2026
Paper-Charles UniversityOptical Music Recognition for Real-World Manuscripts with Synthetic Data-Jun. 2026
Paper-LIGMLeveraging Morphology for Historical Script Metrological Analysis-Jun. 2026
KaiRactersTU WienKaiRacters: Character-Level-Based Writer Retrieval for Greek Papyri-Dec. 2024
-Univ. Modena e Reggio EmiliaBinarizing Documents by Leveraging both Space and Frequency-Aug. 2024
CATMuS MedievalPSL Univ. & ENCCATMuS Medieval: A Multilingual Large-Scale Cross-Century Dataset in Latin Script for Handwritten Text Recognition-Aug. 2024
DELINE8KBrigham Young Univ.DELINE8K: A Synthetic Data Pipeline for Semantic Segmentation of Historical DocumentsGitHub StarsAug. 2024
-Univ. Rennes, IRISATraining Transformer Architectures on Few Annotated Data: Application to Historical Handwritten Text Recognition-2024
ColDBinDFKIColDBin: Cold Diffusion for Document Image Binarization-Aug. 2023
-Univ. of SousseHistorical Document Image Segmentation Combining Deep Learning and Gabor Features-Aug. 2023
-TU WienFeature Mixing for Writer Retrieval and Identification on Papyri FragmentsGitHub StarsAug. 2023

๐Ÿ“„ Tampered Text Detection & Forensics

Tampered text detection and forensics studies document authenticity, manipulation localization, forgery detection, and evidence-grounded verification.

| Venue | Name | Primary affiliation | Title | GitHub

Truncated โ€” view the full README on GitHub.

Contributors

ouyangshengjin

59 commits

Yuliang-Liu

31 commits

xinke-wang

24 commits

Hegburger

15 commits

Yuliang-Liu/AWESOME-OCR-LLM

OCR in the Era of Large Language Models

722

189 commits

updated Sep 22, 2026

See the code

README

๐Ÿ”ญ Daily Papers (2026-09-22)

Document Understanding

VenueNamePrimary affiliationTitleGitHubDate
PaperChart-RVRUniversity of VirginiaMonitorable Chart Reasoning Agents via Verifiable Process RewardsHuggingFace GitHub StarsSep. 2026

Chart-RVR โ€” A reinforcement learning framework that trains chart reasoning agents with verifiable process rewards, decomposing reasoning into auditable structure, evidence-table and derivation blocks instead of answer-only outputs.

Visual Text Generation

VenueNamePrimary affiliationTitleGitHubDate
PaperDuetGenUSTCPlanning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation-Sep. 2026

DuetGen โ€” An autonomous visual text generator that jointly learns autoregressive layout planning and diffusion rendering so that rendering supervision shapes the planner's representations instead of optimizing the two stages separately.

๐Ÿ“– Contents

Overview

A curated, continuously updated reading list of OCR in the era of large language models, covering document parsing and understanding, visual text generation, benchmarks, challenges, and future perspectives, with a focus on research around the past five years (2021โ€“now).

Scope. This list tracks OCR in the LLM era: work that applies large vision-language or multimodal models to text-rich images and documents (parsing, understanding, benchmarks, and specialized text tasks). It is not a general document-AI list, a generic MLLM list, or a classical OCR-1.0 list; such work appears only when it directly bears on text-rich visual understanding.

A note on evaluation. Most recent systems are released as technical reports with self-reported numbers, private test sets, and inconsistent protocols, so cross-paper scores are rarely comparable in a rigorous sense. We list results as reported and, where known, indicate the evaluation basis. The field still lacks a unified, contamination-resistant, reproducible benchmark, and we see building one as a prerequisite for trustworthy leaderboard claims.

๐ŸŽ‰ News

  • [2026-2-11] ๐Ÿ”ฅ We release an open-source resource to help the community easily track recent OCR research!

Contributing. PRs welcome. One row per model, newest first; please include venue/date, affiliation, and a code or model link.

Emerging Trends (2023โ€“2026)

  • End-to-end VLM-based parsing replaces modular OCR pipelines.
  • Reinforcement learning for layout and reading order modeling.
  • OCR-free document understanding models.
  • Scaling down: compact document VLMs under 1B parameters.
  • Long-doc OCR is a scaling problem of tokens and consistency, not just context length.
  • Structure (layout + logic) is the new accuracy.
  • Generative OCR shifts the core risk from โ€œmisrecognitionโ€ to โ€œhallucinationโ€.
  • Benchmarks are moving toward executable evaluation.
  • Document agents and autonomous reasoning over PDFs.
  • Document Agents need recoverability, not one-shot perfection.

๐Ÿ“„ Document Parsing

Document parsing focuses on converting visually complex documents into structured, machine-readable representations. In the LLM era, parsing is no longer a pipeline of isolated modules, but increasingly unified within end-to-end VLM architectures.

VenueNamePrimary affiliationTitleGitHubDate
PrismAlignHuaweiPrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR-Sep. 2026
PaperWeVisDocTencentWeVisDoc: From Coverage to Capability for Robust End-to-End Document ParsingHuggingFace GitHub StarsSep. 2026
PaperJina-OCR-v1Jina AIJina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable RewardsHuggingFaceSep. 2026
PaperOCR-EDRTencentOCR-EDR: Rendering-Aware Diagnosis and Repair for Closed-Loop OCR Improvement-Sep. 2026
PaperWayu-Paxa-OCR-ZeroWayu ResearchHow Far Can Synthetic Data Take Thai OCR?-Sep. 2026
PaperSCVERFudan UniversityState-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models-Sep. 2026
PaperFinixDocAnt GroupFinixDoc: Rethinking Financial Document Parsing Beyond Saturated BenchmarksHuggingFaceAug. 2026
SmolDocling-KV-LinkIBMIdentify, Locate, Link: End-to-End Key-Value Extraction from Document Images-Aug. 2026
PaperArmorOCRAnt GroupArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-DistillationGitHub StarsAug. 2026
PaperNaviDC-OCRChina Telecom AINaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents-Aug. 2026
PaperTongGuOCRSCUTTongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical DocumentsGitHub StarsAug. 2026
PaperPaDocTsinghua UniversityPaDoc: Layout-Grounded Parallel Decoding for Document ParsingGitHub StarsAug. 2026
Logographic PretrainingQMULLogographic Character Visual Pretraining via Semantic-based Contrastive Learning-Aug. 2026
SPIRALSEUSame Semantics, Different Paths: Self-Improving Alignment for Vision-Text CompressionGitHub StarsAug. 2026
DocPOTencentDocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards-Aug. 2026
PaperDrawAIBUPTDrawAI: Agentic Benchmark and Workflow for Making Raster Images EditableHuggingFace GitHub StarsAug. 2026
PaperLayoutLiteYuanli TechnologyLayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCRGitHub StarsJul. 2026
PaperHPD-ParsingBaiduHPD-Parsing: Hierarchical Parallel Document ParsingHuggingFace GitHub StarsJul. 2026
PaperOvisOCR2AlibabaOvisOCR2 Technical ReportHuggingFace GitHub StarsJul. 2026
PaperDocOCR-EvalUniversity of MelbourneDocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth-Jul. 2026
PaperMonkeyOCRv2HUST&KingsoftMonkeyOCRv2: A Visual-Text Foundation Model for Document AIHugging Face GitHub StarsJul. 2026
PaperInfinity-Parser2INF TeamInfinity-Parser2 Technical ReportHugging FaceGitHub StarsJul. 2026
PaperHunyuanOCR-1.5TencentHunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and BetterHuggingFace Stars GitHub StarsJul. 2026
PaperSAYREAlibabaEnhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis-Jul. 2026
PaperP-MTPBaiduP-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling-Jun. 2026
PaperRT-DocLayoutBaiduRT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild-Jun. 2026
PaperUnlimited-OCRBaiduUnlimited OCR WorksGitHub StarsJun. 2026
PaperBeaverMicrosoft ResearchBuilding Agent Harnesses for Scientific Curation from Multimodal Sources-Jun. 2026
PaperAgents-K1Shanghai AI LaboratoryAgents-K1: Towards Agent-native Knowledge OrchestrationHuggingFace StarsJun. 2026
PaperPaddleOCR-VL-1.6BaiduPaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-TrainingGitHub StarsJun. 2026
PaperPP-OCRv6BaiduPP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR TasksGitHub StarsJun. 2026
StrucTabIIE, CASStrucTab: A Structured Optimization Framework for Table ParsingGitHub StarsJun. 2026
PaperExChartZhejiang UniversityMaking Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework-Jun. 2026
PaperMinerU-PopoShanghai AI Laboratory & OpenDataLabMinerU-Popo: Universal Post-Processing Model for Structured Document ParsingGitHub StarsMay. 2026
RTPruneDeepSeekRTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR InferenceGitHub StarsMay. 2026
PaperABot-OCRAlibabaABot-OCR Technical ReportGitHub StarsMay. 2026
PaperBabelDOCfunstory.aiBabelDOC: Better Layout-Preserving PDF Translation via Intermediate RepresentationGitHub StarsMay. 2026
PaperConsensus EntropyFudan UniversityConsensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCRGitHub StarsMay. 2026
PaperFastOCRTsinghua University & JDFastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing-May. 2026
PaperMinerU2.5-ProShanghai AI LaboratoryMinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at ScaleGitHub StarsApr. 2026
PaperPixelPruneOPPOPixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive CodingGitHub StarsApr. 2026
PaperTexOCRYale University & Zhejiang UniversityTexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX ReconstructionGitHub StarsApr. 2026
PaperFalcon OCRFalcon Vision Team, TIIFalcon PerceptionGitHub StarsMar. 2026
PaperMinerU-DiffusionShanghai AI LaboratoryMinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion DecodingGitHub StarsMar. 2026
PaperQianfan-OCRBaiduQianfan-OCR: A Unified End-to-End Model for Document IntelligenceGitHub StarsMar. 2026
Paperdots.mocrHUSTMultimodal OCR: Parse Anything from DocumentsGitHub StarsMar. 2026
PaperFireRed-OCRXiaohongshu IncFireRed-OCR Technical ReportGitHub StarsMar. 2026
PaperAgenticOCRShanghai AI Laboratory & OpenDataLabAgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented GenerationGitHub StarsMar. 2026
PTPTencentEfficient Document Parsing via Parallel Token Prediction-Mar. 2026
PaperLogics-Parsing-OmniAlibabaLogics-Parsing-Omni Technical ReportGitHub StarsMar. 2026

๐Ÿ“„ See full list at Document-Parsing.md

๐Ÿ“„ Document Understanding

Document understanding extends beyond structural parsing to semantic comprehension and reasoning over visually rich documents.

VenueNamePrimary affiliationTitleGitHubDate
PaperChart-RVRUniversity of VirginiaMonitorable Chart Reasoning Agents via Verifiable Process RewardsHuggingFace GitHub StarsSep. 2026
PaperViSARINSA LyonViSAR: Training-Free Adaptive-k Retrieval for Visual Document Question Answering-Sep. 2026
PaperDocIntentSCUTDocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering-Sep. 2026
Doc-REFRAGZhejiang UniversityDoc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented GenerationGitHub StarsSep. 2026
AWMUniversity of OsloAWM: Answerable Working Memory for Long-Document VQA AgentsGitHub StarsAug. 2026
PaperSAGEFudan UniversitySAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding-Aug. 2026
PaperQ-GuideAmazonQuestion-Guided Evidence Acquisition for Multimodal Visual Question Answering-Aug. 2026
PaperDocClawNTUDocClaw: A Unified Agentic System for Intelligent Document ProcessingGitHub StarsAug. 2026
PaperConceptFormerNortheastern UniversityConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document RetrievalGitHub StarsAug. 2026
Hyper-M2RAGHangzhou Dianzi UniversityHypergraph-based Multimodal Retrieval-Augmented Generation with Incremental RefinementGitHub StarsAug. 2026
PaperTridentEmory UniversityWhat the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering-Aug. 2026
PaperD2-ScaleAgentZhejiang UniversityD2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding-Aug. 2026
SEERUT AustinSEER: Long-Context Reasoning via Selective Visual-Text CompressionGitHub StarsAug. 2026
PaperHAM-RAGHKUSTHAM-RAG: Hierarchy-Aware Multimodal RAG for Structure-Faithful Interleaved GenerationGitHub StarsAug. 2026
DRUFShenzhen MSU-BIT UniversityBeyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMsGitHub StarsAug. 2026
PaperDistilVDRAalto UniversityDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationGitHub StarsAug. 2026
PaperInSight-docHKUSTInSight-doc: Agentic Visual Perception for Long-Document UnderstandingGitHub StarsAug. 2026
PaperDocAtlasWuhan University / MicrosoftDocAtlas: Long-Document Understanding as Mutable-State Interaction-Aug. 2026
PaperDocMemoHIT, ShenzhenDocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document UnderstandingGitHub StarsAug. 2026
PaperECFBeihang UniversityDoes More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?GitHub StarsAug. 2026
PaperADOPD 2026Georgia TechThinking with Anchors: Grounded and Efficient Document ReasoningHuggingFace GitHub StarsAug. 2026
PaperVTSMBZUAIWhen Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning-Aug. 2026
PaperQ-CueGraphThe University of TokyoQ-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning-Aug. 2026
PaperDocTraceBaiduDocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning-Aug. 2026
PaperCURVWilliam & MaryCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning-Aug. 2026
PaperRAGOCRPeking UniversityRAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation-Aug. 2026
PaperVaRS-DocSJTUVaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document RetrievalGitHub StarsAug. 2026
PaperET-PruneSJTUET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsGitHub StarsAug. 2026
PaperHierDocUSTCHierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering-Aug. 2026
DualG-MRAGBUAADualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation-Jul. 2026
PaperMMLDSum-LLMOPPOMMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware-Jul. 2026
PaperTAP-RAGTianjin UniversityTAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question AnsweringAnonymous CodeJul. 2026
Perception-RFTQuantiphiStop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment-Jul. 2026
CMDRNTTCMDR: Contextual Multimodal Document RetrievalHuggingFace Stars GitHub StarsJul. 2026
PaperHiEvi-RAGUSTCHierarchical Evidence-Driven Reasoning for Long Document Understanding-Jul. 2026
PaperMultAttnAttribโ€”MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering-Jul. 2026
PaperOracleAnalyserNUDTOracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training-Jun. 2026
PaperDocArenaAdobe ResearchDocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents-Jun. 2026
ViTexQAMeituanViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question AnsweringGitHub Stars HuggingFace DatasetJun. 2026
PaperPreciseDocTsinghua UniversityAn LMM for Precisely Grounding Elements in Documents-Jun. 2026
LightSTARSJTULightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive RefinementGitHub StarsJun. 2026
PaperSciLensHKUSTSciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding-Jun. 2026
PaperSAFE-CascadeWalmartSAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering-Jun. 2026
PaperUMG-RAGPurdue UniversityUncertainty-Aware Hybrid Retrieval for Long-Document RAG-Jun. 2026
PaperMAGE-RAGBITMAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QAGitHub StarsJun. 2026
PaperMINARDUniversity of MarylandHelping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures-Jun. 2026
PaperMM-BizRAGJPMorgan Chase & Co.MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A-Jun. 2026
PaperKG4VDNational Taiwan UniversityMultimodal Graph RAG for Long-range Visually Rich Document UnderstandingGitHub StarsJun. 2026
ZipRerankMagellan Technology Research InstituteVery Efficient Listwise Multimodal Reranking for Long DocumentsGitHub StarsMay. 2026
PaperGeoSym127KSenseTime Research & CUHK ShenzhenGeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric ReasoningGitHub StarsMay. 2026

๐Ÿ“„ See full list at Document-Understanding.md

๐Ÿ“„ Visual Text Generation

Visual Text Generation focuses on generating or editing legible, visually harmonious, and semantically consistent text within images, serving as the creative inverse of OCR. In the LLM era, it is no longer a task reliant on specialized modules, but is emerging as a foundational skill for general-purpose generative models.

VenueNamePrimary affiliationTitleGitHubDate
PaperDuetGenUSTCPlanning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation-Sep. 2026
LoGANNetflixLoGAN: Multilingual Font Localization with Generative Agents-Sep. 2026
PaperGlyphAnchorFudan UniversityGlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph Priors-Sep. 2026
PaperTextRefineKuaishouTextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters-Aug. 2026
PaperPosterTextWuhan UniversityPosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster-Aug. 2026
PaperTransAnyTextWuhan UniversityTransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation-Aug. 2026
onoffGISTBridging Online and Offline Handwriting via Differentiable Physical RenderingGitHub StarsAug. 2026
PaperPosterMELDTsinghua UniversityPosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready OutputsGitHub StarsAug. 2026
InnoTextSYSUInnoText: A Unified Model for Visual Text Generation and Editing-Jul. 2026
PaperBoogu-Image-0.1Boogu Team,HuaweiBoogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationHuggingFace GitHub StarsJul. 2026
PaperSciFormaMicrosoft & Peking UniversitySciForma: Structure-Faithful Generation of Scientific DiagramsGitHub StarsJul. 2026
PaperVecFontLLMFuzhou University & Peking UniversityVecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts-Jul. 2026
PaperArtChartAnt GroupArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering-Jul. 2026
PaperDataEvolverCSUDataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image GenerationGitHub StarsJul. 2026
PaperQwen-Image-2.0-RLAlibabaQwen-Image-2.0-RL Technical Report-Jun. 2026
UniTranslatorIIE CASUniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine TranslationGitHub StarsJun. 2026
PaperSteerVTEByteDance & Peking UniversitySteerVTE: Seamless Video Text Editing with Style and Glyph Control-Jun. 2026
PaperDiffMathSCUT & HuaweiDiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression GenerationGitHub StarsJun. 2026
PaperPhyDrawGenUniversity of DhakaPhyDrawGen: Physically Grounded Diagram Generation from Natural Language-Jun. 2026
PaperNIVReichman UniversityNIV: Neural Axis Variations for Variable Font GenerationGitHub StarsJun. 2026
PaperQwen-Image-2.0Alibaba GroupQwen-Image-2.0 Technical ReportGitHub StarsMay. 2026
PaperMangaFlowThe University of TokyoMangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation-May. 2026
PaperWan-ImageAlibaba GroupWan-Image: Pushing the Boundaries of Generative Visual Intelligence-Apr. 2026
PosterIQPolyUPosterIQ: A Design Perspective Benchmark for Poster Understanding and GenerationGitHub StarsMar. 2026
PaperEfficientPosterGenTsinghua UniversityEfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation DetectionGitHub StarsMar. 2026
PaperTextFlowNJUSTTowards Training-Free Scene Text EditingGitHub StarsMar. 2026
PaperGlyphPrinterFudan UniversityGlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text RenderingGitHub StarsMar. 2026
PaperCTRL-SSJTUReliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning-Mar. 2026
PaperLaDeAdobe ResearchLaDe: Unified Multi-Layered Graphic Media Generation and Decomposition-Mar. 2026
PaperEchoGenUSTCEchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding-Mar. 2026
PaperWebVRStepFunWebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics-Mar. 2026
PaperAutoFigure-EditWestlake UniversityAutoFigure-Edit: Generating Editable Scientific IllustrationGitHub StarsMar. 2026
PaperGlyphBananaSJTU & Xiaohongshu Inc.GlyphBanana: Advancing Precise Text Rendering Through Agentic WorkflowsGitHub StarsMar. 2026
PaperInnoAds-ComposerJD.comInnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation-Mar. 2026
PaperSeeing is ImprovingUSTCSeeing is Improving: Visual Feedback for Iterative Text Layout RefinementGitHub StarsMar. 2026
PosterOmniHKUST(GZ)PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward FeedbackGitHub StarsFeb. 2026
TextPeckerHUSTTextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text RenderingGitHub StarsFeb. 2026
PaperSSPTTongji UniversitySpace Syntax-guided Post-training for Residential Floor Plan Generation-Feb. 2026
PaperChatUMMTsinghua University & Tencent HunyuanChatUMM: Robust Context Tracking for Conversational Interleaved Generation-Feb. 2026
PosterVerseSCUTPosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable TypographyGitHub StarsJan. 2026
-GPT-Image-1.5OpenAIGPT-Image-1.5---Dec. 2025
-Gemini 3 Pro ImageGoogle DeepMindGemini 3 Pro Image (Nano Banana Pro)---Nov. 2025
-Gemini 2.5 Flash ImageGoogle DeepMindGemini 2.5 Flash Image (Nano Banana)---Oct. 2025
PaperQwen-ImageQwen TeamQwen-Image Technical ReportGitHub StarsSep. 2025
PaperSeedream 4.0ByteDance SeedSeedream 4.0: Toward Next-generation Multimodal Image Generation---Aug. 2025
PaperPostergenStony Brook UniversityPostergen: Aesthetic-aware paper-to-poster generation via multi-agent llmsGitHub StarsAug. 2025
UniGlyphTsinghua UniversityUniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis---Jul. 2025
PaperX-OmniTencent Hunyuan XX-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great AgainGitHub StarsJul. 2025
Paper DreamPosterIntelligent Creation Lab, ByteDanceDreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design---Jul. 2025
PosterCraftHKUST(GZ)PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified FrameworkGitHub StarsJun. 2025

๐Ÿ“„ See full list at Visual-Text-Generation.md

๐Ÿ“„ Specialized Model

Beyond general document parsing and understanding, traditional OCR research remains essential for specialized visual-text structures, restoration, temporal analysis, and forensic reliability.

๐Ÿ“„ Document Dewarping

Document dewarping restores photographed or scanned pages to a geometrically rectified and readable form.

VenueNamePrimary affiliationTitleGitHubDate
PaperBookNetHFUTBookNet: Dual-Page Book Image Rectification via Cross-Page Attention-Jan. 2026
PaperTADocCASTADoc: Robust Time-Aware Document Image Dewarping-Aug. 2025
PaperDocDewarpHVHITDual Dimensions Geometric Representation Learning Based Document DewarpingGitHub StarsJul. 2025
DocMatcherFZI & KITDocMatcher: Document Image Dewarping via Structural and Textual Line MatchingGitHub StarsMar. 2025
Paper-Shuya Branch of the Ivanovo State UniversityEfficient Document Image Dewarping via Hybrid Deep Learning and Cubic Polynomial Geometry RestorationGitHub StarsJan. 2025
DocScannerUSTCDocScanner: Robust Document Image Rectification with Progressive LearningGitHub StarsJan. 2025
DocResSCUTDocRes: A Generalist Model Toward Unifying Document Image Restoration TasksGitHub StarsJun. 2024
DocNLCSCUTDocNLC: A Document Image Enhancement Framework with Normalized and Latent Contrastive Representation for Multiple DegradationsGitHub StarsFeb. 2024
DocTr++USTCDeep Unrestricted Document Image Rectification-2024
LA-DocFlattenCASLayout-aware Single-image Document FlatteningGitHub Stars2024
UVDocETH ZurichUVDoc: Neural Grid-based Document UnwarpingGitHub StarsOct. 2023
Foreground and Text-lines Aware ModelHIT Shenzhen, ChinaForeground and text-lines aware document image rectificationGitHub StarsJun. 2023
DocMAEUSTC & iFLYTEKDocMAE: Document Image Rectification via Self-supervised Representation Learning-2023
MariorSCUT & IntSigMarior: Margin Removal and Iterative Content Rectification for Document Dewarping in the WildGitHub StarsOct. 2022

๐Ÿ“„ Physical Structure Analysis

Physical structure analysis identifies document regions, layouts, and spatial relationships before semantic reasoning.

VenueNamePrimary affiliationTitleGitHubDate
PaperPorTEXTONOVA School of Science and TechnologyPorTEXTO: A European Portuguese Benchmark for Visual Text Extraction-Jun. 2026
Paper-Insiders Technologies GmbHBounding Box Label Propagation for Re-Annotation of Document Layout Analysis Datasets-Jun. 2026
PaperIndustryBench-MIPUMultimodal and Industrial AI Team, AlibabaIndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial ProductsGitHub StarsJun. 2026
PaperERN-NetTamkang UniversityERN-Net : Evolving Reason Node-Net for Document Binarization-Jun. 2026
HiLExIEM KolkataHiLEx: Image-Based Hierarchical Layout Extraction from Question PapersGitHub StarsMar. 2025
DCEM-ViTSharda University, Greater Noida, IndiaDevanagari character encoded mix-merge vision transformer for robust document layout analysis---Mar. 2025
Efficient Additive Attention DLATechnical University of Kaiserslautern, GermanyEfficient Additive Attention for Transformer-based Semi-supervised Document Layout Analysis---Feb. 2025
DocSemiTechnical University of Kaiserslautern, GermanyDocSemi: Efficient Document Layout Analysis with Guided Queries---Feb. 2025
FS-QCSNetChina University of Mining and TechnologyFew-Shot Quaternion-valued Correlation Squeeze Network for Document Image Layout Segmentation---Jan. 2025
LayoutDETRSalesforce ResearchLayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer-Sep. 2024
LayoutLLMAlibaba GroupLayoutLLM: Layout Instruction Tuning with Large Language Models for Document UnderstandingGitHub StarsJun. 2024
RoDLAKIT & Univ. of OxfordRoDLA: Benchmarking the Robustness of Document Layout Analysis ModelsGitHub StarsJun. 2024
DocLLMJPMorgan Chase & Co.DocLLM: A Layout-Aware Generative Language Model for Multimodal Document UnderstandingGitHub StarsMay 2024
SemiDocSegComputer Vision Center, Barcelona, SpainSemiDocSeg: Harnessing Semi-Supervised Learning for Document Layout Analysis---Mar. 2024
VGTAlibaba GroupVision Grid Transformer for Document Layout AnalysisGitHub StarsOct. 2023
GeoLayoutLMAlibaba GroupGeoLayoutLM: Geometric Pre-training for Visual Information ExtractionGitHub StarsJun. 2023
M6DocSCUTM6Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout AnalysisGitHub StarsJun. 2023
HRDocUSTC & iFLYTEKHRDoc: Dataset and Baseline Method Toward Hierarchical Reconstruction of Document StructuresGitHub StarsFeb. 2023
LayoutLMv3MicrosoftLayoutLMv3: Pre-training for Document AI with Unified Text and Image MaskingGitHub StarsOct. 2022

๐Ÿ“„ Reading Order Prediction

Reading order prediction recovers the intended sequence of text and visual elements in complex page layouts.

VenueNamePrimary affiliationTitleGitHubDate
PaperOrliUniversity of KonstanzEnd-to-End Text Line Detection and OrderingGitHub StarsJun. 2026
PaperFocalOrderUnisound AI Technology Co. Ltd.FocalOrder: Focal Preference Optimization for Reading Order Detection-Jan. 2026
PaperROAPUESTCROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information ExtractionGitHub StarsJan. 2026
PaperXY-cut++Tianjin UniversityXY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark-Apr. 2025
UniHDSAUSTC & Microsoft Research AsiaUniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure AnalysisGitHub Stars2025
HanDoc-OrderOCRNCCU & Academia SinicaReading between the Lines: Image-Based Order Detection in OCR for Chinese Historical Documents-Feb. 2024
Detect-Order-ConstructUSTC & Microsoft Research AsiaDetect-Order-Construct: A Tree Construction Based Approach for Hierarchical Document Structure AnalysisGitHub Stars2024
Reading Order MattersFudan UniversityReading Order Matters: Information Extraction from Visually-rich Documents by Token Path PredictionGitHub StarsDec. 2023
LayoutLMv3SYSULayoutLMv3: Pre-training for Document AI with Unified Text and Image MaskingGitHub StarsOct. 2022

๐Ÿ“„ Mathematical Expression Recognition

Mathematical expression recognition converts printed or handwritten formulas into structured symbolic representations.

VenueNamePrimary affiliationTitleGitHubDate
Paper-University of AlicanteDirect content-based retrieval from music scores images-May. 2026
PaperMusicSynth-MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition-May. 2026
PaperTranscodaHeinrich Heine University DรผsseldorfTranscoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic TrainingGitHub StarsMay. 2026
PaperFrom Image to Music LanguageFindLabFrom Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR-Apr. 2026
UniMERNetOpenDataLab & Shanghai AI LabUniMERNet: A Universal Network for Real-World Mathematical Expression RecognitionGitHub StarsJun. 2025
CDMOpenDataLabImage Over Text: Transforming Formula Recognition Evaluation with Character Detection MatchingGitHub StarsJun. 2025
SSANInner Mongolia UniversitySSAN: A Symbol Spatial-Aware Network for Handwritten Mathematical Expression RecognitionGitHub StarsApr. 2025
TAMERPeking UniversityTAMER: Tree-Aware Transformer for Handwritten Mathematical Expression RecognitionGitHub StarsApr. 2025
JournalVLPGUCASVisionโ€“language pre-training for graph-based handwritten mathematical expression recognitionGitHub StarsJan. 2025
BATUSTC & iFLYTEKBidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression RecognitionGitHub Stars2025
LattEPurdue UniversityLattE: Improving LaTeX Recognition with Iterative RefinementGitHub StarsSep. 2024
-TUAT & VGU & RIT & Nantes Univ.A Survey on Handwritten Mathematical Expression Recognition: The Rise of Encoder-Decoder and GNN Models-Sep. 2024
NAMERUSTC & iFLYTEK ResearchNAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition-Sep. 2024
HMEGHangzhou Dianzi Univ.Generating Handwritten Mathematical Expressions from Symbol Graphs: An End-to-End Pipeline-Jun. 2024
BPDSCUTA Tree-Based Model with Branch Parallel Decoding for Handwritten Mathematical Expression Recognition-2024
SAN (Syntax-Aware Net)Tomorrow Advancing LifeSyntax-Aware Network for Handwritten Mathematical Expression RecognitionGitHub StarsJun. 2022

๐Ÿ“„ Table & Chart Understanding

Table and chart understanding covers structure recognition, data extraction, grounding, retrieval, and visual reasoning over structured graphics.

VenueNamePrimary affiliationTitleGitHubDate
Paper-Teamreboott Inc.Rethinking the Pointer Loss in Table Structure Recognition: Geometry-Aware Pointer Loss for Spatial LocalityGitHub StarsJun. 2026
Paper-Preferred Networks, Inc.Revisiting Structural Dependency in Autoregressive Multi-Task Table Recognition via Order-Independent Cell-Level Representations-Jun. 2026
PaperChartLensShandong UniversityChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary RefinementGitHub StarsJun. 2026
PaperPOTATRKensho Technologies (S&P Global)POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction-Jun. 2026
JournalChartReLAUniversity of Science, Ho Chi Minh city, VietnamChartReLA: A compact vision-language model for comprehensivechart reasoning via relationship modelingGitHub StarsJan. 2026
Table-R1XJTU-Liverpool UniversityCan GRPO Boost Complex Multimodal Table Understanding?-Dec. 2025
TinyChartAlibaba & TsinghuaTinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging-Nov. 2024
ReachQAFudan UniversityDistill Visual Chart Reasoning Ability from LLMs to MLLMsGitHub StarsOct. 2024
OmniParserAlibaba GroupOmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table RecognitionGitHub StarsJun. 2024
DePlotGoogleDePlot: One-shot visual language reasoning by plot-to-table translationGitHub StarsJul. 2023
TableVLMFudan UniversityTableVLM: Multi-modal Pre-training for Table Structure Recognition-Jul. 2023
VASTHuaweiImproving Table Structure Recognition with Visual-Alignment Sequential Coordinate Modeling-Jun. 2023
LOREAlibaba GroupLORE: Logical Location Regression Network for Table Structure RecognitionGitHub StarsFeb. 2023
ChartQAYork UniversityChartQA: A Benchmark for Question Answering about Charts with Visual and Logical ReasoningGitHub StarsJul. 2022
LGPMAHikvisionLGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask AlignmentGitHub StarsSep. 2021

๐Ÿ“„ Scene Text Understanding

Scene text understanding unifies text detection, recognition, and spotting in natural images and related real-world settings.

VenueNamePrimary affiliationTitleGitHubDate
PaperNext-Generation Parallel Decoder for LPDRNUTECHNext-Generation Parallel Decoder for LPDR: Architectural Optimization and Class-Balanced GAN-Augmentation-Jun. 2026
Paper-Polytechnic University of TurinDo You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting-May. 2026
PaperMNSPNankai UniversityMasked Next-Scale Prediction for Self-supervised Scene Text RecognitionGitHub StarsMay. 2026
Paper-Afeka Academic College of EngineeringMapping License Plate Recoverability Under Extreme Viewing Angles for Oppor-tunistic Urban Sensing-Apr. 2026
DPText-DETRWuhan Univ.DPText-DETR: Towards Better Scene Text Detection with Dynamic Points in TransformerGitHub StarsFeb. 2023
DeepSoloWuhan UniversityDeepSolo: Let Transformer Decoder with Explicit Points Solo for Text SpottingGitHub StarsNov. 2022
ABINet++USTCABINet++: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text SpottingGitHub StarsNov. 2022
SwinTextSpotterSCUTSwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text RecognitionGitHub StarsMar. 2022
ABCNet v2SCUTABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text SpottingGitHub StarsMay. 2021
PAN++Nanjing UniversityPAN++: Towards Efficient and Accurate End-to-End Spotting of Arbitrarily-Shaped TextGitHub StarsMay. 2021
MANGOHikvision Research InstituteMANGO: A Mask Attention Guided One-Stage Scene Text SpotterGitHub StarsDec. 2020
Mask TextSpotter v3HUSTMask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text SpottingGitHub StarsJul. 2020
Text perceptronHikvision Research InstituteText perceptron: Towards end-to-end arbitrary-shaped text spottingGitHub StarsApr. 2020
ABCNetSCUTABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve NetworkGitHub StarsFeb. 2020

๐Ÿ“„ Text Removal & Editing

Text removal and editing modifies textual content in images while preserving visual consistency and surrounding appearance.

VenueNamePrimary affiliationTitleGitHubDate
PaperProductConsistencyFractal AnalyticsProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RLGitHub StarsJun. 2026
Paper-Fudan UniversityUnified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification-Jun. 2026
PaperUniDDTNanjing UniversityUniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer-Jun. 2026
PaperTextWandPeking UniversityTextWand: A Unified Framework for Scene Text Editing-Jun. 2026
TMIMUSTCLeveraging Text Localization for Scene Text Removal via Text-Aware Masked Image ModelingGitHub StarsSep. 2024
PowerPaintTsinghua & Shanghai AI LabPowerPaint: A Task is Worth One Word โ€” Learning with Task Prompts for High-Quality Versatile Image InpaintingGitHub StarsSep. 2024
MagicEraserHuaweiย  & SIAT, CASMagicEraser: Erasing Any Objects via Semantics-Aware Control-Sep. 2024
TurboEditAdobeTurboEdit: Instant Text-based Image EditingGitHub StarsSep. 2024
SPDInvHKUSTSource Prompt Disentangled Inversion for Boosting Image EditabilityGitHub StarsSep. 2024
DARLINGUSTCChoose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing-Jun. 2024
SceneTextGenMeta & RutgersLayout-Agnostic Scene Text Image Synthesis with Diffusion Models-Jun. 2024
-KAISTPrompt Augmentation for Self-supervised Text-guided Image Manipulation-Jun. 2024
ViTEraserSCUTViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM PretrainingGitHub StarsFeb. 2024
FETNetKyushu Univ.FETNet: Feature Erasing and Transferring Network for Scene Text RemovalGitHub Stars2023

๐Ÿ“„ Text Image Super-Resolution

Text image super-resolution restores low-resolution text regions while preserving character identity and legibility.

VenueNamePrimary affiliationTitleGitHubDate
PaperFDFAnhui UniversityFrequency Decoupled Framework for Screen Content Image Super-Resolution-Jun. 2026
PaperDTG-RestoreVirginia TechDTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution-Jun. 2026
PaperEverything at Every ScaleMITEverything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution-May. 2026
PaperPRISMSJTUPRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-ResolutionGitHub StarsMay. 2026
TextDiffBUPTTextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution-2025
PEANSoutheast Univ.PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-ResolutionGitHub StarsOct. 2024
DCDMIIT RoorkeeDCDM: Diffusion-Conditioned-Diffusion Model for Scene Text Image Super-ResolutionGitHub StarsSep. 2024
DiffTSRBIT & SenseTimeDiffusion-based Blind Text Image Super-ResolutionGitHub StarsJun. 2024
SGENetFudan Univ. & Videt Tech.SGENet: Efficient Scene Text Image Super-Resolution with Semantic Guidance-Apr. 2024
STIRERTongji Univ. & Fudan Univ.STIRER: A Unified Model for Low-Resolution Scene Text Image Recovery and RecognitionGitHub StarsOct. 2023
DocDiffBUPTDocDiff: Document Enhancement via Residual Diffusion ModelsGitHub StarsOct. 2023
-HIT & NTULearning Generative Structure Prior for Blind Text Image Super-ResolutionGitHub StarsJun. 2023
DPMNSoutheast Univ.DPMN: Improving Scene Text Image Super-Resolution via Dual Prior Modulation NetworkGitHub StarsFeb. 2023
TPGSRHong Kong PolyUText Prior Guided Scene Text Image Super-ResolutionGitHub Stars2023

๐Ÿ“„ Handwritten Document Analysis

Handwritten document analysis covers handwriting recognition, writer-related analysis, signatures, and document-level handwritten content.

VenueNamePrimary affiliationTitleGitHubDate
Paper-LTUPerformance Gap Analysis between Latin and Arabic Scripts HTR-Jun. 2026
PaperPrototypical Signature ApproachETS / LIVIA Lab, Universite du QuebecA Prototypical Signature Approach for Writer-Independent Offline Signature VerificationGitHub StarsJun. 2026
PaperStringalign-Stringalign: Moving beyond summary statistics with a transparent Unicode-aware tool for evaluating automatic transcription models-Jun. 2026
Paper-Offenburg UASIntelligent Character Recognition of Handwritten Forms with Deep Neural Networks-Jun. 2026
MetaWriterConcordia Univ. & MilaMetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning-Jun. 2025
-Univ. of AlicanteOn the Generalization of Handwritten Text Recognition Models-Jun. 2025
DetailSemNetNYCU, TaiwanDetailSemNet: Elevating Signature Verification through Detail-Semantic Integration-Sep. 2024
TransOSVXi'an Jiaotong Univ.TransOSV: Offline Signature Verification with Transformers-2024

๐Ÿ“„ Video Text Analysis

Video text analysis studies temporal text detection, recognition, spotting, tracking, and reasoning across video frames.

VenueNamePrimary affiliationTitleGitHubDate
PaperTraRARIKENTraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban SurveillanceGitHub StarsJun. 2026
PaperBeyond DetectionNankai UniversityBeyond Detection: A Structure-Aware Framework for Scene Text Tracking-May. 2026
PaperVTAgentWuhan UniversityVTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA-May. 2026
VimTSHUSTVimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-Domain GeneralizationGitHub StarsApr. 2025
GoMatchingWuhan Univ. & NTUGoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term MatchingGitHub StarsDec. 2024
TransDeTRZhejiang Univ. & BUPTTransDeTR: End-to-End Video Text Spotting with TransformerGitHub Stars2024
BiRViT-1KCASIAVideo Text Detection With Robust Feature Representation-2024

๐Ÿ“„ Historical Document Analysis

Historical document analysis addresses OCR, restoration, structure recovery, and interpretation for manuscripts and archival materials.

VenueNamePrimary affiliationTitleGitHubDate
AlphaOracleHUSTAlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learningGitHub StarsJul. 2026
PaperUrdu Katib Handwritten DatasetUniversity of Gujrat, PakistanUrdu Katib Handwritten Dataset: A Historical Document Dataset for Offline Urdu Handwritten Text Recognition with CRNN-Based Baseline Evaluation-Jun. 2026
Paper-UMRE, ItalyA Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts-Jun. 2026
Paper-Charles UniversityOptical Music Recognition for Real-World Manuscripts with Synthetic Data-Jun. 2026
Paper-LIGMLeveraging Morphology for Historical Script Metrological Analysis-Jun. 2026
KaiRactersTU WienKaiRacters: Character-Level-Based Writer Retrieval for Greek Papyri-Dec. 2024
-Univ. Modena e Reggio EmiliaBinarizing Documents by Leveraging both Space and Frequency-Aug. 2024
CATMuS MedievalPSL Univ. & ENCCATMuS Medieval: A Multilingual Large-Scale Cross-Century Dataset in Latin Script for Handwritten Text Recognition-Aug. 2024
DELINE8KBrigham Young Univ.DELINE8K: A Synthetic Data Pipeline for Semantic Segmentation of Historical DocumentsGitHub StarsAug. 2024
-Univ. Rennes, IRISATraining Transformer Architectures on Few Annotated Data: Application to Historical Handwritten Text Recognition-2024
ColDBinDFKIColDBin: Cold Diffusion for Document Image Binarization-Aug. 2023
-Univ. of SousseHistorical Document Image Segmentation Combining Deep Learning and Gabor Features-Aug. 2023
-TU WienFeature Mixing for Writer Retrieval and Identification on Papyri FragmentsGitHub StarsAug. 2023

๐Ÿ“„ Tampered Text Detection & Forensics

Tampered text detection and forensics studies document authenticity, manipulation localization, forgery detection, and evidence-grounded verification.

| Venue | Name | Primary affiliation | Title | GitHub

Truncated โ€” view the full README on GitHub.

Contributors

ouyangshengjin

59 commits

Yuliang-Liu

31 commits

xinke-wang

24 commits

Hegburger

15 commits