MLS-Bench Lite — leaderboard

Official 30-task subset of MLS-Bench for evaluating whether AI systems can invent generalizable and scalable machine-learning methods.

Metric: Score. Source: mls-bench.com. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1Claude Fable 549.9
2Kimi K348.3
3GPT-5.6 Sol46.2
4Claude Opus 4.842.8
5GPT-5.6 Terra40.8
6GLM-5.240.4
7GPT-5.6 Luna39.1
8GPT-5.535.5
9Kimi K2.7 Code35.1
10Claude Sonnet 531.1
11Kimi K2.626.7
12DeepSeek V4 Pro24.4

Interactive version: theaggregate.ai/benchmark?slug=mls-bench-lite · How the rankings work · Data refreshed daily, snapshot 2026-07-22.