Wolfram LLM Benchmarking Project: leaderboard

Ongoing Wolfram Language code-generation benchmark from Wolfram Research. Models produce executable Wolfram Language code and are scored on syntax validity and functional correctness.

Metric: Correct Functionality (%). Source: www.wolfram.com. Status: years away from saturation. 535 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (Thinking)72.5
2Gemini 3 Pro (Preview)71.2
3Gemini 3.1 Pro (Preview)71.1
4Gemini 3 Flash (Preview)69.2
5Claude Opus 4.5 (Thinking)68.9
6GPT-5.5 (xHigh)68.8
7Qwen 3.6 Max Preview68.7
8Claude Opus 4.768.4
9GPT-5.6 Sol (xHigh)68.3
10Muse Spark 1.167.8
11GLM-5.1 (Thinking)67.8
12Qwen 3.7 Max (2026-06-08)67.7
13GPT-5.6 Sol (Medium)67.4
14Kimi K2.6 (Thinking)67.3
15Grok 4.20 (Reasoning)66.3

Interactive version: theaggregate.ai/benchmark?slug=wolfram-llm-benchmarking-project · How It Works · Data refreshed daily, snapshot 2026-09-05.