BFCL V4 - Multi Turn: leaderboard
Metric: Accuracy (%). Source: gorilla.cs.berkeley.edu. 109 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 4.5 (20251101) | 68.38 |
| 2 | Gemini 3 Pro (Preview) | 63.12 |
| 3 | O3 (2025-04-16) | 62.25 |
| 4 | Claude Sonnet 4.5 | 61.37 |
| 5 | Grok 4.1 Fast (Reasoning) | 58.87 |
| 6 | Claude Haiku 4.5 (20251001) | 53.62 |
| 7 | Nanbeige4-3B-Thinking-2511 | 51.12 |
| 8 | Kimi K2 | 50.63 |
| 9 | Qwen 3 32B | 47.87 |
| 10 | Grok 4 | 47 |
| 11 | Grok 4.1 Fast (Non-reasoning) | 46.75 |
| 12 | Qwen 3 235B A22B 2507 Instruct | 45.38 |
| 13 | GPT-5.2 | 43.75 |
| 14 | Qwen 3 8B | 41.75 |
| 15 | O4 Mini (2025-04-16) | 41.75 |
Interactive version: theaggregate.ai/benchmark?slug=bfcl-v4-multi-turn · How It Works · Data refreshed daily, snapshot 2026-09-19.