vCX-Hard - Tool Calling (Reasoning): leaderboard

Metric: Tool-Call Accuracy (%). Source: www.retellai.com. 27 models tracked.

Top models

#ModelScore
1GPT-5.588.3
2Gemini 3.1 Pro (Preview)85.9
3Claude Sonnet 4.585.8
4Gemini 3.5 Flash84
5GLM-5.183.8
6GPT-5.183.7
7GPT-583.2
8Gemini 3 Flash81.8
9GPT-5.281.5
10Gemini 2.5 Pro80.6
11Claude Sonnet 4.680.4
12Claude Haiku 4.579.4
13GPT-5.477.4
14Gemini 3.1 Flash Lite75.8
15GPT-5 Mini75.6

Interactive version: theaggregate.ai/benchmark?slug=vcx-hard-tool-calling-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-21.