P-Bench - Qwen-Image-Bench: leaderboard

P-Bench scores text-to-image providers over the Qwen-Image-Bench prompt set with P-Judge, the overall quality judge PrunaAI runs itself, alongside price per image and median generation time.

Metric: P-Judge Overall. Source: huggingface.co. 40 models tracked.

Top models

#ModelScore
1GPT Image 259.02
2P Image 2 Ideogram Very High 1K58.28
3GPT Image 1.557.86
4Nano Banana Pro56.45
5Nano Banana 2.056.36
6Qwen Image 2.0 Pro56.18
7P Image 2 Ideogram High 1K55.75
8Seedream 5.055.72
9Seedream 4.555.66
10Seedream 4.055.24

Interactive version: theaggregate.ai/benchmark?slug=p-bench-qwen-image-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.