WeGenBench - Text Rendering: leaderboard
Metric: Character-level F1 (0-1 scaled to %) between the text rendered in the image (read by the TextPecker VLM reader) and the target text; images generated from the 2,000 bilingual WeGenBench-Text prompts that require rendering given text; API refusals are left out of the average; higher is better. Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 18 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Seedream-4.5 | 79 |
| 2 | GLM-Image | 78 |
| 3 | ERNIE-Image-Turbo (No Prompt Enhancer) | 75 |
| 4 | SenseNova-U1-8B-MoT | 74 |
| 5 | Z-Image-Turbo | 73 |
| 6 | SenseNova-U1-8B-MoT (Thinking) | 72 |
| 7 | HunyuanImage-3.0-Instruct-Distil (Image) | 70 |
| 8 | HunyuanImage-3.0-Instruct (Image) | 69 |
| 9 | ERNIE-Image-Turbo (Prompt Enhancer) | 65 |
| 10 | HunyuanImage-3.0-Instruct (Think-Rewrite) | 63 |
Interactive version: theaggregate.ai/benchmark?slug=wegenbench-text-rendering · How It Works · Data refreshed daily, snapshot 2026-09-29.