ATC Safety-Oriented Language Understanding Eval: leaderboard

Safety-oriented air-traffic-control language-understanding evaluation for structured ATC utterances, consequence-aware entity/action scoring, and operational-risk sensitivity.

Metric: Risk Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 11 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)69.22
2Gemini 3 Pro (Preview)68.84
3GPT-5.167.75
4Qwen 3 Max52.34
5Grok 4.1 Fast (Reasoning)52.06
6GPT-4o Mini44.83
7Qwen Plus43.52
8Qwen 3 32B42.49
9DeepSeek V3 Chat40.03
10Qwen 3 8B28.8
11Qwen 3 14B25.85

Interactive version: theaggregate.ai/benchmark?slug=atc-safety-oriented-language-understanding-eval · How It Works · Data refreshed daily, snapshot 2026-09-05.