PatternEval (Non-Thinking): leaderboard

Metric: Accuracy (%; correctness of the final user-visible answer under the source task's criteria, judged by Qwen3-Max; non-thinking inference; PatternEval: 2,415 failure-enriched image-prompt pairs in three task families (visual perception and grounding, OCR and structured images, multimodal knowledge reasoning); official default decoding with only the reasoning control changed). Source: arxiv.org. Saturation forecast: Around March 2027. 25 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max (Non-reasoning)67.07
2Seed 2.0 Pro (Non-reasoning)66.85
3Kimi K2.6 (Non-reasoning)66.47
4Qwen 3.7 Plus (Non-reasoning)66.28
5Qwen 3.5 397B A17B (Non-reasoning)61.96
6Kimi K2.5 (Non-reasoning)61.33
7Claude Opus 4.861.12
8GPT-5.4 (Non-reasoning)60.66
9Claude Opus 4.659.45
10GPT-5.5 (Non-reasoning)59.2
11Qwen 3.5 122B A10B (Non-reasoning)59.2
12Qwen 3.5 27B (Non-reasoning)59.07
13Qwen 3.6 27B (Non-reasoning)57.33
14Qwen 3.5 35B A3B (Non-reasoning)57.02
15Qwen 3.6 35B A3B (Non-reasoning)56.22

Interactive version: theaggregate.ai/benchmark?slug=patterneval-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-29.