Time to REFLECT — leaderboard

Metric: Overall (Report Quality) (self-reported). Source: benchmarklist.com. 14 models tracked.

Top models

#ModelScore
1GPT-5.3 Codex47.5
2GPT-OSS-120B46.5
3GPT-5 Mini43.5
4Qwen 3 32B39.5
5GPT-5.438
6Claude Opus 4.735
7Gemini 3.1 Pro (Preview)32.5
8Claude Haiku 4.532.5
9Qwen 3 235B A22B27
10Gemini 2.5 Flash24.5
11Gemma 3 27B20
12Qwen 3 8B14.5
13Llama 3.1 70B9.5
14Gemini 2.0 Flash4.5

Interactive version: theaggregate.ai/benchmark?slug=time-to-reflect · How the rankings work · Data refreshed daily, snapshot 2026-07-22.