FrameBench - English: leaderboard

Metric: Accuracy (%; mean of five prompt templates). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)99.3
2GPT-599.1
3Qwen 3.5 27B (Thinking)98.6
4Gemma 4 31B (IT) (Thinking)98.6
5Gemma 4 31B (IT) (Non-reasoning)97.5
6Qwen 3.5 9B (Thinking)97.3
7Qwen 3.5 27B (Non-reasoning)96.1
8Qwen 3.5 4B (Thinking)95.5
9Gemma 4 E4B (IT) (Thinking)94.5
10GPT-5 Nano93.5
11Gemma 4 E2B (IT) (Thinking)86.3
12Qwen 3.5 9B (Non-reasoning)85.8
13Gemma 4 E4B (IT) (Non-reasoning)82.5
14Qwen 3.5 4B (Non-reasoning)81.1
15Qwen 3.5 2B (Thinking)80.3

Interactive version: theaggregate.ai/benchmark?slug=framebench-english · How It Works · Data refreshed daily, snapshot 2026-09-19.