MCP-Universe (LLM w/ Function Calls) — leaderboard

MCP-Universe benchmarks LLMs on application-centric multi-step workflows across 6 task categories. Function calling track from Salesforce AI Research.

Metric: Avg Evaluator Score. Source: mcp-universe.github.io. Status: saturation imminent. 21 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)61.67
2Grok 4.1 Fast60.58
3GPT-5 (Medium)59.29
4Claude Sonnet 4.554.38
5Claude Sonnet 452.61
6Grok 4 Fast52.2
7Claude Sonnet 4 (Thinking)50.83
8Kimi K2 (Thinking)45.23
9Claude Haiku 4.544.63
10Grok Code Fast 143.89
11GPT-OSS-120B39.78
12GPT-4.139.58
13DeepSeek V3.138.88
14Kimi K2 090538.52
15GLM-4.537.58

Interactive version: theaggregate.ai/benchmark?slug=mcp-universe-llm-w-function-calls · How the rankings work · Data refreshed daily, snapshot 2026-07-22.