Wolfram LLM Benchmarking Project — leaderboard

Ongoing Wolfram Language code-generation benchmark from Wolfram Research. Models produce executable Wolfram Language code and are scored on syntax validity and functional correctness.

Metric: Correct Functionality (%). Source: www.wolfram.com. Status: saturation imminent. 507 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (Thinking)72.5
2Gemini 3 Pro (Preview)71.2
3Gemini 3.1 Pro (Preview)71.1
4Gemini 3 Flash (Preview)69.2
5Claude Opus 4.5 (Thinking)68.9
6GPT-5.5 (xHigh)68.8
7Qwen 3.6 Max Preview68.7
8Claude Opus 4.768.4
9Claude Opus 4.8 (Thinking)68.1
10GLM-5.1 (Thinking)67.8
11Kimi K2.6 (Thinking)67.3
12Grok 4.20 (Reasoning)66.3
13Claude Opus 4.865.9
14Kimi K2.565.8
15Claude Opus 4.565.1

Interactive version: theaggregate.ai/benchmark?slug=wolfram-llm-benchmarking-project · How the rankings work · Data refreshed daily, snapshot 2026-07-22.