MLE-Bench (OpenAI): leaderboard

75 Kaggle-style ML engineering competitions. Measures end-to-end ability to read, code, and submit solutions - graded against real human leaderboards.

Metric: Medal Rate (%). Source: github.com. 28 models tracked.

Top models

#ModelScore
1Famou-Agent 2.064.44
2AIBuildAI63.11
3CAIRMARS+62.67
4MLEvolve61.33
5PiEvolve(Fractal AI Research)61.33
6Famou-Agent 2.059.56
7ML-Master 2.056.44
8CAIRMARS56
9PiEvolve(Fractal AI Research)52
10Leeroo50.67

Interactive version: theaggregate.ai/benchmark?slug=mle-bench-openai · How It Works · Data refreshed daily, snapshot 2026-09-05.