MixEval Chat: leaderboard

Chat-model split of MixEval (NUS and CMU, 2024): 4,000 ground-truth queries drawn from 20 benchmarks such as MMLU, DROP and TriviaQA to match web user queries, run zero-shot, parsed by GPT-3.5.

Source: mixeval.github.io. Status: saturated.

Interactive version: theaggregate.ai/benchmark?slug=mixeval-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.