Towards Evaluation of Implicit Software World Models in Coding LLMs: leaderboard

Metric: F1 (%). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1GPT-5.50.84
2GPT-OSS-120B0.6
3Claude Sonnet 4.60.55
4GPT-5 Mini0.5
5Claude Opus 4.70.49
6Qwen 3.5 397B A17B0.45
7GPT-5.20.39
8GPT-5.40.38
9Claude Haiku 4.50.28
10Qwen 3 235B A22B0.14
11Qwen 3 30B A3B0.05

Interactive version: theaggregate.ai/benchmark?slug=towards-evaluation-of-implicit-software-world-models-in-coding-llms · How It Works · Data refreshed daily, snapshot 2026-09-19.