Nejumi 4 - BFCL - Multi-Turn: leaderboard

Metric: Accuracy (%). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)66.67
2Claude Opus 4.5 (Thinking)66.67
3Claude Opus 4.7 (xHigh)66.67
4Claude Opus 4.1 (Thinking)66.67
5Claude Opus 5 (Max)65.56
6Claude Opus 4.5 (Non-reasoning)65.56
7Claude Opus 4.6 (Thinking)64.44
8Claude Opus 4.8 (xHigh)64.44
9GPT-4o Mini (2024-07-18)61.67
10Claude Sonnet 4.6 (Thinking)61.11
11MiniMax M3 (Thinking)61.11
12Claude Opus 4 (Non-reasoning)60
13Claude 3.5 Sonnet58.89
14GPT-5.6 Luna (Max)58.89
15Grok 356.67

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-bfcl-multi-turn · How It Works · Data refreshed daily, snapshot 2026-09-19.