PortBench-QA: leaderboard

Metric: Mean item score (%; mean of seven QA templates, 50 test questions per model per template, thinking on, temperature 0). Source: arxiv.org. Saturation forecast: Around December 2026. 10 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max (Thinking)81.9
2DeepSeek V4 Flash (Thinking)81.9
3DeepSeek V4 Pro (Thinking)81.8
4Qwen 3.6 Plus (Thinking)78.3
5GLM-5.1 (Thinking)75.7
6Qwen 3.6 35B A3B (Thinking)68.4
7Kimi K2.6 (Thinking)51.1

Interactive version: theaggregate.ai/benchmark?slug=portbench-qa · How It Works · Data refreshed daily, snapshot 2026-09-26.