BrainBench (EEG) - CodeAct - Sleep Assessment: leaderboard

Metric: EEG analysis score (0-100). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Claude Opus 573.53
2GPT-5.6 Sol (Non-reasoning)69.24
3Qwen 3.7 Max (Non-reasoning)67.8
4GLM-5 (Non-reasoning)64.65
5MiniMax-M2.563.43
6GPT-5.6 Terra (Non-reasoning)62.35
7Kimi K2.5 (Non-reasoning)62.28
8Qwen 3.7 Plus (Non-reasoning)62.06
9DeepSeek V4 Flash (Non-reasoning)61.01
10Qwen 3.5 122B A10B (Non-reasoning)57.18
11Qwen 3.5 35B A3B (Non-reasoning)50.18
12GPT-5.6 Luna (Non-reasoning)41.63

Interactive version: theaggregate.ai/benchmark?slug=brainbench-eeg-codeact-sleep-assessment · How It Works · Data refreshed daily, snapshot 2026-09-19.