K-MetBench: leaderboard

Expert meteorology benchmark over 1,774 Korean National Meteorological Engineer Examination questions, including reasoning, geo-cultural, text-only, and multimodal subsets.

Metric: Accuracy (self-reported). Source: benchmarklist.com. Status: saturation imminent. 59 models tracked.

Top models

#ModelScore
1Qwen 3 VL 235B A22B (Thinking)84.4
2Qwen 3 VL 32B (Thinking)78.6
3command-a-reasoning-08-202577.8
4GPT-OSS-120B77.3
5Qwen 3 30B A3B 2507 (Thinking)76.7
6EXAONE 4.5 33B75.9
7Qwen 3 VL 30B A3B (Thinking)74.9
8Qwen 3 14B73.7
9Qwen 3 VL 235B A22B Instruct72.4
10Qwen 3 VL 8B (Thinking)71.7
11GPT-OSS-20B71.5
12Qwen 3 8B70.1
13Qwen 3 4B 2507 (Thinking)67.8
14Qwen 3 VL 32B Instruct67.5
15Qwen 3 VL 4B (Thinking)66.1

Interactive version: theaggregate.ai/benchmark?slug=k-metbench · How It Works · Data refreshed daily, snapshot 2026-09-05.