Nejumi 4 - GLP - Function Calling: leaderboard

Metric: Score (%). Source: nejumi.ai. 126 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol72.53
2Claude Opus 4.772.16
3Claude Opus 4.871.91
4Claude Opus 4.171.42
5Claude Opus 4.571.3
6Claude Opus 470.06
7Claude Opus 569.94
8Claude Opus 4.669.75
9Claude Fable 569.69
10Qwen 3.6 27B69.51
11Qwen 3.6 Max Preview69.44
12Claude Sonnet 468.95
13Gemini 3 Pro (Preview)68.77
14Gemini 3.1 Pro (Preview)68.64
15GLM-5.268.52

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-glp-function-calling · How It Works · Data refreshed daily, snapshot 2026-09-05.