XpertBench - Engineering and Applied Sciences: leaderboard

Metric: Weighted rubric score (%) on the XpertBench-Gold subset (245 expert-written open-ended professional tasks, 15-40 weighted binary checkpoints each); ShotJudge: Gemini 2.5 Pro judges every checkpoint with an expert-graded GPT-5 response as one-shot exemplar; engineering and applied sciences tasks; higher is better. Source: arxiv.org. Saturation forecast: Around January 2028. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Thinking)49.58
2GPT-5 (High)48.2
3GPT-5.2 (High)46.13
4GPT-5.4 (High)42.84
5Gemini 3.1 Pro (Preview)37.3
6Kimi K2 (Thinking)37.1
7Gemini 3 Pro36.34
8DeepSeek V3.1 Terminus (Thinking)32.2
9Gemini 3 Flash31.56
10Doubao-Seed-1.6 (Thinking)29.5
11Claude Sonnet 4.5 (Thinking)27.5
12GLM-4.627.4
13Gemini 2.5 Pro25.5

Interactive version: theaggregate.ai/benchmark?slug=xpertbench-engineering-and-applied-sciences · How It Works · Data refreshed daily, snapshot 2026-10-07.