Benchmark Catalog

5615 public benchmarks tracked with scores, source links, and saturation status. The most broadly covered benchmarks are listed below.

BenchmarkCategoryMetricModelsSaturation
Open LLM Leaderboard - BBHScore586
Open LLM Leaderboard - GPQAScore586
Open LLM Leaderboard - IFEvalScore586
Open LLM Leaderboard - MATH Level 5Score586
Open LLM Leaderboard - MMLU-ProScore586
Open LLM Leaderboard - MuSRScore586
Artificial Analysis Intelligence IndexIntelligence Index482
AA GPQA DiamondMath, Logic & ReasoningAccuracy (%)477saturated
AA Humanity's Last ExamGeneral Knowledge & LanguageAccuracy (%)468years away from saturation
AA CritPtMath, Logic & ReasoningAccuracy (%)413saturation imminent
AA OmniscienceGeneral Knowledge & LanguageScore408saturation imminent
AA Omniscience - BusinessAccuracy (%)408
AA Omniscience - HealthAccuracy (%)408
AA Omniscience - Humanities & Social SciencesAccuracy (%)408
AA Omniscience - LawAccuracy (%)408
AA Omniscience - Software Engineering (SWE)Accuracy (%)408
AA-Omniscience AccuracyAccuracy (%)408
AA Omniscience - Science, Engineering & MathematicsAccuracy (%)407
AA Long Context ReasoningGeneral Knowledge & LanguageAccuracy (%)404saturation imminent
BenchmarkList ECICapability Index (ECI)364
AA IFBenchGeneral Knowledge & LanguageAccuracy (%)345years away from saturation
AA TAU-2 BenchAgentic & Tool UseAccuracy (%)337years away from saturation
AA Terminal-Bench HardCoding & Software EngineeringAccuracy (%)331saturation imminent
UGI - Natural IntelligenceNatInt Score315
UGI - Willingness (W/10)W/10 Score315
UGI LeaderboardUGI Score315
UGI - WritingWriting Score307
Chatbot Arena (Text - English)Arena Score304
Chatbot Arena (Text - Hard Prompts)Arena Score304
Chatbot Arena (Text - Instruction Following)Arena Score304
Chatbot Arena (Text)Elo304
LLM Stats ScoreLLM Stats Score (conservative rating)304
Chatbot Arena (Text - Coding)Arena Score303
Chatbot Arena (Text - Creative Writing)Arena Score303
Chatbot Arena (Text - Multi-Turn)Arena Score303
Wolfram LLM Benchmarking ProjectCoding & Software EngineeringCorrect Functionality (%)297years away from saturation
Chatbot Arena (Text - Longer Query)Arena Score295
Chatbot Arena (Text - Math)Arena Score295
Chatbot Arena (Text - Chinese)Arena Score289
Chatbot Arena (Text - Russian)Arena Score289
SpeechMap Compliance% Requests Completed286
AI Chess Leaderboard (Reasoning)Games & PuzzlesElo285saturation imminent
Open Chinese LLM - ARC ChallengeAccuracy (%)258
Open Chinese LLM - C-Eval SemanticAccuracy (%)258
Open Chinese LLM - CMMLUAccuracy (%)258
Open Chinese LLM - GSM8KAccuracy (%)258
Open Chinese LLM - HellaSwagAccuracy (%)258
Open Chinese LLM - TruthfulQA MCAccuracy (%)258
Open Chinese LLM - WinoGrandeAccuracy (%)258
Open Chinese LLM LeaderboardGeneral Knowledge & LanguageAverage Score (%)258saturated
OTIS Mock AIME 2024-25Math, Logic & ReasoningAccuracy (%)248saturated
Chatbot Arena (Text - German)Arena Score245
CritPtScience & Domain KnowledgeAccuracy (self-reported)242saturation imminent
AI Chess Leaderboard (Continuation)Games & PuzzlesElo240years away from saturation
LM Market Cap LMC ScoreLMC Score (0-100)237
Chatbot Arena (Text - French)Arena Score236
Chatbot Arena (Text - Spanish)Arena Score236
EuroEval Dutch NLU - DBRDSentiment classification Score (%)232
EuroEval Icelandic KnowledgeKnowledge Average Score (%)228
EuroEval Norwegian Common Sense ReasoningCommon Sense Reasoning Average Score (%)228

Interactive version: theaggregate.ai/benchmarks · How It Works · Data refreshed daily, snapshot 2026-09-05.