BFCL V4 - Multi Turn: leaderboard

Metric: Accuracy (%). Source: gorilla.cs.berkeley.edu. 109 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)68.38
2Gemini 3 Pro (Preview)63.12
3O3 (2025-04-16)62.25
4Claude Sonnet 4.561.37
5Grok 4.1 Fast (Reasoning)58.87
6Claude Haiku 4.5 (20251001)53.62
7Nanbeige4-3B-Thinking-251151.12
8Kimi K250.63
9Qwen 3 32B47.87
10Grok 447
11Grok 4.1 Fast (Non-reasoning)46.75
12Qwen 3 235B A22B 2507 Instruct45.38
13GPT-5.243.75
14Qwen 3 8B41.75
15O4 Mini (2025-04-16)41.75

Interactive version: theaggregate.ai/benchmark?slug=bfcl-v4-multi-turn · How It Works · Data refreshed daily, snapshot 2026-09-19.