WideResearch (BenchLM): leaderboard

Metric: Task Score (%). Source: benchlm.ai. 15 models tracked.

Top models

#ModelScore
1Hy4 preview83.9
2Qwen 3.8 Max81.9
3Kimi K2.680.8
4Ornith-1.5-397B80.8
5Dots3-Note (Preview)78.9
6Claude Opus 4.576.4
7Qwen 3.6 Plus74.3
8Qwen 3.5 397B A17B74
9Ling-3.0-flash73.6
10Kimi K2.572.7
11GLM-569.8
12Ornith-1.5-35B-A3B67.8
13Qwen 3.6 35B A3B60.1
14Ornith-1.5-9B59.5

Interactive version: theaggregate.ai/benchmark?slug=wideresearch-benchlm · How It Works · Data refreshed daily, snapshot 2026-09-19.