BFCL V4 - Web Search: leaderboard

Metric: Accuracy (%). Source: gorilla.cs.berkeley.edu. 109 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)84.5
2Claude Haiku 4.5 (20251001)83.5
3Grok 4.1 Fast (Reasoning)82.5
4Grok 482
5GPT-5 Mini82
6Claude Sonnet 4.581
7Gemini 3 Pro (Preview)80
8O3 (2025-04-16)77
9GPT-5.275.5
10O4 Mini (2025-04-16)75.5
11Grok 4.1 Fast (Non-reasoning)75
12GPT-5 Nano72.5
13DeepSeek V3.2 Exp69.5
14GPT-4.168
15Kimi K266.5

Interactive version: theaggregate.ai/benchmark?slug=bfcl-v4-web-search · How It Works · Data refreshed daily, snapshot 2026-09-19.