POLAR-Bench: leaderboard

Metric: Overall Mean (self-reported). Source: benchmarklist.com. 22 models tracked.

Top models

#ModelScore
1GLM-5.194.34
2GPT-5.492.33
3Gemma 4 31B91.2
4Gemma 4 E4B90.87
5DeepSeek V3.190.81
6Llama 3.3 70B86.23
7Kimi K2.585.4
8Gemma 3 27B83.16
9DeepSeek R1 Distill Qwen 32B81.19
10Qwen 3 32B80.87
11GLM-4.7 Flash80
12Gemma 4 E2B79.74
13Ministral 3 8B76.12
14GPT-OSS-120B74.62
15Ministral 3 14B71.96

Interactive version: theaggregate.ai/benchmark?slug=polar-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.