FLY-EVAL++ - Single-Step Prediction - Safety Constraints: leaderboard

Metric: S1 D4 safety score (%). Source: arxiv.org. 21 models tracked.

Top models

#ModelScore
1Grok 492.8
2Gemini 3 Pro92.7
3GPT-592.1
4DeepSeek R1 052891.2
5O4 Mini90.4
6Kimi K2 (Thinking)88
7Gemini 2.5 Pro86.2
8GLM-4.678.8
9Claude Sonnet 4.570.6
10Llama 3.1 405B70.2
11Claude 3.7 Sonnet (20250219)69.9
12Kimi K2 090568.5
13DeepSeek V3.167.5
14DeepSeek V3.2 Exp66.4
15DeepSeek V364.5

Interactive version: theaggregate.ai/benchmark?slug=fly-eval-plus-plus-single-step-prediction-safety-constraints · How It Works · Data refreshed daily, snapshot 2026-09-19.