EDCT-Bench (Rubric-Graded): leaderboard
Metric: Counterfactual Consistency Score, rubric-graded (%; LLM-judge 1-5 faithfulness rating of the answer and explanation after verified minimal image edits rescaled to 0-1, k=2, Qwen3-235B-A22B judge, FLUX.2 Max editor). Source: arxiv.org. Saturation forecast: Around October 2027. 6 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 2.5 Flash (Thinking) | 60 |
| 2 | GLM-4.6V (Reasoning) | 59 |
| 3 | Qwen 3 VL 8B Instruct | 57 |
| 4 | Gemma 3 27B | 55 |
| 5 | Pixtral-12B | 52 |
Interactive version: theaggregate.ai/benchmark?slug=edct-bench-rubric-graded · How It Works · Data refreshed daily, snapshot 2026-09-26.