FLY-EVAL++ - Multi-Step Rollout - Total: leaderboard

Metric: M3 total score (%). Source: arxiv.org. 21 models tracked.

Top models

#ModelScore
1Gemini 3 Pro91.8
2GPT-591.29
3DeepSeek V3.2 Exp91.17
4DeepSeek V390.79
5GPT-4o90.63
6Llama 3.1 405B90.53
7Claude Sonnet 4.590.47
8Claude 3.7 Sonnet (20250219)90.19
9Qwen 3 32B90.17
10Qwen 3 235B A22B90.15
11DeepSeek R1 052890.1
12Qwen 2.5 32B90.09
13Qwen3-Next-80B89.9
14Kimi K2 (Thinking)89.71
15Seed-1.689.34

Interactive version: theaggregate.ai/benchmark?slug=fly-eval-plus-plus-multi-step-rollout-total · How It Works · Data refreshed daily, snapshot 2026-09-19.