RE-Edit - Referential: leaderboard

Metric: Pass rate (%) on the referential-reasoning subset of RE-Edit's 1,000 curated edit requests (which object the request refers to): a Qwen3-VL-30B judge marks each edited image pass or fail against the case rationale; higher is better. Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 12 models tracked.

Top models

#ModelScore
1Seedream 4.053.4
2FLUX.2-dev50.5
3Qwen-Image-Edit50
4Nano Banana48
5Step1X-Edit-v1p2-preview47.5
6Ovis-U1-3B39.2
7Step1X-Edit-v1p138.2
8OmniGen238.2
9DreamOmni236.8
10FLUX.1 Kontext [dev]35.3

Interactive version: theaggregate.ai/benchmark?slug=re-edit-referential · How It Works · Data refreshed daily, snapshot 2026-09-29.