Benchmark Catalog

5206 public benchmarks tracked with scores, source links, and saturation status. The most broadly covered benchmarks are listed below.

BenchmarkCategoryMetricModelsSaturation
Open LLM Leaderboard - BBHScore766
Open LLM Leaderboard - GPQAScore766
Open LLM Leaderboard - IFEvalScore766
Open LLM Leaderboard - MATH Level 5Score766
Open LLM Leaderboard - MMLU-ProScore766
Open LLM Leaderboard - MuSRScore766
AA GPQA DiamondMath, Logic & ReasoningAccuracy (%)419saturated
Artificial Analysis Intelligence IndexIntelligence Index416
AA Humanity's Last ExamGeneral Knowledge & LanguageAccuracy (%)414saturation imminent
AA SciCodeCoding & Software EngineeringAccuracy (%)412saturation imminent
AA Long Context ReasoningGeneral Knowledge & LanguageAccuracy (%)366saturation imminent
AA CritPtMath, Logic & ReasoningAccuracy (%)353saturation imminent
AA IFBenchGeneral Knowledge & LanguageAccuracy (%)351saturation imminent
AA OmniscienceGeneral Knowledge & LanguageScore349saturated
AA Omniscience - BusinessAccuracy (%)349
AA Omniscience - HealthAccuracy (%)349
AA Omniscience - Humanities & Social SciencesAccuracy (%)349
AA Omniscience - LawAccuracy (%)349
AA Omniscience - Science, Engineering & MathematicsAccuracy (%)349
AA Omniscience - Software Engineering (SWE)Accuracy (%)349
AA Omniscience - Software Engineering (SWE) - CAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - DartAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - GoAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - HTMLAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - JavaAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - JavaScriptAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - JuliaAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - KotlinAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - PHPAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - PythonAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - RAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - RustAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - SwiftAccuracy (%)349
AA Omniscience - Software Engineering (SWE) - TypeScriptAccuracy (%)349
AA-Omniscience AccuracyAccuracy (%)349
AA TAU-2 BenchAgentic & Tool UseAccuracy (%)343saturated
AA Terminal-Bench HardCoding & Software EngineeringAccuracy (%)338saturation imminent
Open Korean LLM LeaderboardGeneral Knowledge & LanguageAverage Score (%)311saturated
Epoch AI - ECILeaderboards & AggregatorsECI Score307saturated
UGI - Natural IntelligenceNatInt Score307
UGI - Willingness (W/10)W/10 Score307
UGI LeaderboardUGI Score307
UGI - WritingWriting Score298
Wolfram LLM Benchmarking ProjectCoding & Software EngineeringCorrect Functionality (%)289saturation imminent
Chatbot Arena (Text)Elo283
AA MMLU-ProGeneral Knowledge & LanguageAccuracy (%)271saturated
AA-LCRGeneral Knowledge & LanguageScore (self-reported)271saturated
CritPtScience & Domain KnowledgeAccuracy (self-reported)271saturation imminent
AA LiveCodeBenchCoding & Software EngineeringPass@1 (%)270saturated
AI Chess Leaderboard (Reasoning)Games & PuzzlesElo257saturated
Open Chinese LLM - ARC ChallengeAccuracy (%)257
Open Chinese LLM - C-Eval SemanticAccuracy (%)257
Open Chinese LLM - CMMLUAccuracy (%)257
Open Chinese LLM - GSM8KAccuracy (%)257
Open Chinese LLM - HellaSwagAccuracy (%)257
Open Chinese LLM - TruthfulQA MCAccuracy (%)257
Open Chinese LLM - WinoGrandeAccuracy (%)257
Open Chinese LLM LeaderboardGeneral Knowledge & LanguageAverage Score (%)257saturation imminent
SpeechMap Compliance% Requests Completed254
EuroEval Dutch NLU - DBRDSentiment classification Score (%)252

Interactive version: theaggregate.ai/benchmarks · How the rankings work · Data refreshed daily, snapshot 2026-07-22.