Multi-IF: leaderboard

4,501 three-turn instruction-following conversations in 8 languages built from IFEval prompts (Meta, 2024); each turn adds verifiable constraints; average accuracy across turns and languages.

Metric: Average (self-reported). Source: benchmarklist.com. Status: saturation imminent. 15 models tracked.

Top models

#ModelScore
1O1 Preview87.7
2Ling-3.0-flash87.7
3Llama 3.1 405B85.4
4O1 Mini85.3
5GPT-4o84.3
6Qwen 2.5 72B83.7
7Llama 3.1 70B82.6
8Claude 3.5 Sonnet81.7
9GPT-481.5
10Mistral Large 2 (Jul)80.5
11Claude 3 Sonnet78.2
12Gemini 1.5 Pro75.8
13Claude 3 Haiku72.9
14Gemini 1.5 Flash72.5
15Llama 3.1 8B68.8

Interactive version: theaggregate.ai/benchmark?slug=multi-if · How It Works · Data refreshed daily, snapshot 2026-09-05.