PureDocBench - Clean - Table TEDS: leaderboard

Metric: Table Tree-Edit-Distance-based Similarity (0-100) between the predicted and reference HTML tables, on the clean track (pages rendered straight from their HTML/CSS source) of 1,475 source pages in 10 domains and 66 subcategories, rendered from LLM-written HTML/CSS with source-linked annotations for text, formulas, tables and reading order; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 58 models tracked.

Top models

#ModelScore
1Claude Opus 592.17
2GLM-5.3 Flash90.76
3Qwen 3.8 27B87.69
4Gemini 3.6 Flash86.76
5Qwen 3.5 122B A10B83.03
6GPT-5.6 Sol82.87
7Kimi K2.6 (Non-reasoning)80.3
8Qwen 3.5 9B79.39
9Qwen 3.5 4B78.02
10Qwen3.8-Flash-Next76.93
11Qwen 3.6 27B76.47
12Qwen 3.6 35B A3B76.25
13Gemini 3.1 Pro (Preview)75.08
14Qwen 3.5 27B72.51
15Qwen 3.5 2B70.7

Interactive version: theaggregate.ai/benchmark?slug=puredocbench-clean-table-teds · How It Works · Data refreshed daily, snapshot 2026-10-07.