BFCL V4 - Memory: leaderboard

Metric: Accuracy (%). Source: gorilla.cs.berkeley.edu. 109 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)73.76
2Claude Sonnet 4.564.95
3Gemini 3 Pro (Preview)61.72
4Grok 455.91
5Claude Haiku 4.5 (20251001)54.41
6DeepSeek V3.2 Exp54.19
7Grok 4.1 Fast (Reasoning)53.98
8O3 (2025-04-16)51.83
9GPT-5.245.81
10Nanbeige3.5-Pro (Thinking)45.16
11GPT-5 Mini44.3
12Gemini 2.5 Flash41.29
13Nanbeige4-3B-Thinking-251136.77
14O4 Mini (2025-04-16)35.27
15Kimi K229.03

Interactive version: theaggregate.ai/benchmark?slug=bfcl-v4-memory · How It Works · Data refreshed daily, snapshot 2026-09-19.