EDCT-Bench (Rubric-Graded): leaderboard

Metric: Counterfactual Consistency Score, rubric-graded (%; LLM-judge 1-5 faithfulness rating of the answer and explanation after verified minimal image edits rescaled to 0-1, k=2, Qwen3-235B-A22B judge, FLUX.2 Max editor). Source: arxiv.org. Saturation forecast: Around October 2027. 6 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash (Thinking)60
2GLM-4.6V (Reasoning)59
3Qwen 3 VL 8B Instruct57
4Gemma 3 27B55
5Pixtral-12B52

Interactive version: theaggregate.ai/benchmark?slug=edct-bench-rubric-graded · How It Works · Data refreshed daily, snapshot 2026-09-26.