ParsiEval: leaderboard

Metric: Accuracy (%, 364 questions). Source: github.com. 31 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro84.62
2GPT-4o79.12
3GPT-5 Mini77.75
4Kimi K277.2
5Llama 4 Maverick Instruct75.27
6DeepSeek V3 (0324)74.73
7Llama 3.3 70B73.35
8Llama 4 Scout Instruct71.43
9Qwen 3 235B A22B 2507 Instruct70.6
10GPT-OSS-120B70.05
11Gemma 3 27B (IT)67.03
12Qwen 3 30B A3B (Thinking)65.66
13GPT-4.1 Nano63.74
14GPT-OSS-20B63.74
15Gemma 2 9B (IT)59.62

Interactive version: theaggregate.ai/benchmark?slug=parsieval · How It Works · Data refreshed daily, snapshot 2026-09-20.