WildTrace: leaderboard

Metric: Rubric credit (%; mean of three non-contestant LLM judges (Claude Sonnet 4.6, Qwen3.5-Plus, Gemini 2.5 Flash) grading answers against criterion-level rubrics, over 481 multi-hop questions on 214 long technical reports and literary works given in full without evidence spans, up to about 1M tokens; a document longer than the model context window is not sent and scores zero; higher is better). Source: arxiv.org. Saturation forecast: Around December 2026. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.3
2Claude Opus 4.872.6
3GPT-5.571
4GLM-5.270.9
5Qwen 3.7 Max70.1
6Claude Opus 4.669.2
7Qwen 3.6 Plus66.7
8Qwen 3.7 Plus65.7
9GPT-5.462.2
10Gemini 2.5 Pro61.4
11GPT-4.160.4
12GPT-5.142.1
13Qwen 3 Max35.2
14Kimi K2.635.1
15DeepSeek V3.233

Interactive version: theaggregate.ai/benchmark?slug=wildtrace · How It Works · Data refreshed daily, snapshot 2026-09-29.