vCX-Hard - Tool Calling: leaderboard

Metric: Tool-Call Accuracy (%). Source: www.retellai.com. 27 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)85.7
2Claude Sonnet 4.680.1
3GPT-5.279.6
4GPT-5.178.2
5Claude Sonnet 4.577.5
6GLM-5.177.3
7GPT-5.575.6
8GPT-5.475.2
9O4 Mini73.9
10Gemini 2.5 Pro72.9
11Gemini 3 Flash71.2
12Claude Haiku 4.570.7
13GPT-5 Mini70.6
14Gemini 3.5 Flash69.2
15Gemini 3.1 Flash Lite69

Interactive version: theaggregate.ai/benchmark?slug=vcx-hard-tool-calling · How It Works · Data refreshed daily, snapshot 2026-09-21.