BFCL V4 - Non-Live AST: leaderboard
Metric: Accuracy (%). Source: gorilla.cs.berkeley.edu. 109 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3 Pro (Preview) | 90.65 |
| 2 | Qwen 3 235B A22B 2507 Instruct | 90.33 |
| 3 | Qwen 3 32B | 90.27 |
| 4 | Mistral Small 3.2 | 89.69 |
| 5 | Claude Opus 4.5 (20251101) | 89.65 |
| 6 | Qwen 3 14B | 89.46 |
| 7 | Llama 4 Scout Instruct | 89.38 |
| 8 | Qwen 3 30B A3B 2507 Instruct | 88.92 |
| 9 | GPT-4.1 | 88.69 |
| 10 | Claude Sonnet 4.5 | 88.65 |
| 11 | Llama 4 Maverick Instruct FP8 | 88.65 |
| 12 | Qwen 3 8B | 88.56 |
| 13 | Grok 4.1 Fast (Reasoning) | 88.27 |
| 14 | Grok 4.1 Fast (Non-reasoning) | 88.13 |
| 15 | Gemini 2.5 Flash | 88.08 |
Interactive version: theaggregate.ai/benchmark?slug=bfcl-v4-non-live-ast · How It Works · Data refreshed daily, snapshot 2026-09-19.