Document Processing and Vision-Language Models

10 repos

Tools and frameworks for extracting, analyzing, and processing documents using optical character recognition (OCR) and vision-language models (VLMs). This cluster combines infrastructure for document digitization and understanding with large language model serving systems, enabling end-to-end workflows that transform images and PDFs into structured data. Central projects include OCR pipelines, dataset statistics and deduplication utilities, and vLLM for efficient model inference.

Python · 1
hf-jobs ·292
ocr ·241
uv-script ·217
document-processing ·166
vision-language-model ·159
extraction ·159
uv ·82
huggingface ·82
agents ·82
pep723 ·82