FLY-EVAL++ - Single-Step Prediction - Total: leaderboard

Metric: S1 total score (%). Source: arxiv.org. 21 models tracked.

Top models

#ModelScore
1Gemini 3 Pro87.77
2DeepSeek R1 052887.76
3GPT-587.69
4O4 Mini87.41
5Kimi K2 (Thinking)86.68
6Gemini 2.5 Pro86.12
7Llama 3.1 405B83.33
8Kimi K2 090582.8
9Claude Sonnet 4.582.5
10Grok 482.41
11DeepSeek V3.182.36
12Claude 3.7 Sonnet (20250219)82.36
13GLM-4.682.11
14DeepSeek V3.2 Exp81.92
15DeepSeek V381.71

Interactive version: theaggregate.ai/benchmark?slug=fly-eval-plus-plus-single-step-prediction-total · How It Works · Data refreshed daily, snapshot 2026-09-19.