ASCIIArt-Bench - Generation (Generalization): leaderboard

Metric: Weighted composite score (x100) of five Gemini 3 Pro judge dimensions scored 0 to 1 from the rendered image and raw text (instruction faithfulness 0.35, semantic alignment 0.25, structural coherence 0.15, spatial logic 0.15, character efficiency 0.10), text-to-ASCII-art generation on ASCIIArt-Bench's Generalization subset (novel instructions written by Gemini-3-Pro); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 10 models tracked.

Top models

#ModelScoreOverall rank
1Claude Sonnet 4.572.2#138
2GPT-5.265#105
3Kimi K253.9#236
4DeepSeek V3.252.8#198
5Gemini 3 Flash50.5#93
6Seed-1.646.5#257
7Qwen 2.5 72B Instruct45.1#436
8Qwen 2.5 32B Instruct44.1#491
9Qwen 2.5 7B Instruct34.2#846

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=asciiart-bench-generation-generalization · How It Works · Data refreshed daily, snapshot 2026-10-11.