MLS-Bench Lite: leaderboard

Official 30-task subset of MLS-Bench for evaluating whether AI systems can invent generalizable and scalable machine-learning methods.

Metric: Score. Source: mls-bench.com. Status: years away from saturation. 10 models tracked.

Top models

#ModelScore
1Claude Fable 549.9
2Kimi K348.3
3GPT-5.6 Sol46.2
4Claude Opus 4.842.8
5Qwen 3.8 Max41
6GLM-5.240.4
7GPT-5.535.5
8Kimi K2.7 Code35.1
9Qwen 3.7 Max31.7
10Kimi K2.626.7

Interactive version: theaggregate.ai/benchmark?slug=mls-bench-lite · How It Works · Data refreshed daily, snapshot 2026-09-05.