WeGenBench - Text Rendering Sentence Accuracy: leaderboard
Metric: Sentence accuracy (0-1 scaled to %), the exact-match rate of rendered text segments against the target text; images generated from the 2,000 bilingual WeGenBench-Text prompts that require rendering given text; API refusals are left out of the average; higher is better. Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 18 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Seedream-4.5 | 59 |
| 2 | GPT-Image-2 | 57 |
| 3 | GLM-Image | 56 |
| 4 | HunyuanImage-3.0-Instruct (Image) | 56 |
| 5 | HunyuanImage-3.0-Instruct (Think-Rewrite) | 56 |
| 6 | ERNIE-Image-Turbo (Prompt Enhancer) | 56 |
| 7 | ERNIE-Image-Turbo (No Prompt Enhancer) | 56 |
| 8 | Nano-banana-2 | 55 |
| 9 | HunyuanImage-3.0-Instruct-Distil (Think-Rewrite) | 54 |
| 10 | HiDream-O1-Image | 54 |
Interactive version: theaggregate.ai/benchmark?slug=wegenbench-text-rendering-sentence-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-29.