VLM-as-judge pairwise evaluation of OCR models. Rankings depend on document type — there is no single best OCR model.
| Rank | Model | Params | ELO | 95% CI | Wins | Losses | Ties | Win% |
|---|---|---|---|---|---|---|---|---|
| 1 | zai-org/GLM-OCR | 0.9B | 1716 | 1673–1769 | 182 | 60 | 2 | 75% |
| 2 | lightonai/LightOnOCR-2-1B | 1B | 1697 | 1655–1749 | 158 | 61 | 1 | 72% |
| 3 | numind/NuExtract3 | 4B | 1649 | 1604–1708 | 162 | 82 | 0 | 66% |
| 4 | FireRedTeam/FireRed-OCR | 2.1B | 1506 | 1469–1548 | 115 | 127 | 2 | 47% |
| 5 | deepseek-ai/DeepSeek-OCR | 4B | 1421 | 1374–1465 | 90 | 153 | 1 | 37% |
| 6 | rednote-hilab/dots.ocr | 1.7B | 1011 | 881–1090 | 10 | 234 | 0 | 4% |
davanstrien/ocr-bench-britannicaload_dataset("davanstrien/ocr-bench-britannica-results-qwen35") — leaderboard tableload_dataset("davanstrien/ocr-bench-britannica-results-qwen35", name="comparisons") — full pairwise comparison logload_dataset("davanstrien/ocr-bench-britannica-results-qwen35", name="metadata") — evaluation run historyGenerated by ocr-bench
22 commits
VLM-as-judge pairwise evaluation of OCR models. Rankings depend on document type — there is no single best OCR model.
| Rank | Model | Params | ELO | 95% CI | Wins | Losses | Ties | Win% |
|---|---|---|---|---|---|---|---|---|
| 1 | zai-org/GLM-OCR | 0.9B | 1716 | 1673–1769 | 182 | 60 | 2 | 75% |
| 2 | lightonai/LightOnOCR-2-1B | 1B | 1697 | 1655–1749 | 158 | 61 | 1 | 72% |
| 3 | numind/NuExtract3 | 4B | 1649 | 1604–1708 | 162 | 82 | 0 | 66% |
| 4 | FireRedTeam/FireRed-OCR | 2.1B | 1506 | 1469–1548 | 115 | 127 | 2 | 47% |
| 5 | deepseek-ai/DeepSeek-OCR | 4B | 1421 | 1374–1465 | 90 | 153 | 1 | 37% |
| 6 | rednote-hilab/dots.ocr | 1.7B | 1011 | 881–1090 | 10 | 234 | 0 | 4% |
davanstrien/ocr-bench-britannicaload_dataset("davanstrien/ocr-bench-britannica-results-qwen35") — leaderboard tableload_dataset("davanstrien/ocr-bench-britannica-results-qwen35", name="comparisons") — full pairwise comparison logload_dataset("davanstrien/ocr-bench-britannica-results-qwen35", name="metadata") — evaluation run historyGenerated by ocr-bench
22 commits