ClassEval — leaderboard
Class-level code generation benchmark evaluating class and function success under multiple prompting strategies.
Metric: Class-Level Pass@1 (%). Source: fudanselab-classeval.github.io. Status: years away from saturation. 33 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4 | 37.6 |
| 2 | GPT-3.5 | 29.6 |
Interactive version: theaggregate.ai/benchmark?slug=classeval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.