ProLLM - Q&A Assistant — leaderboard

ProLLM benchmark measuring LLM quality as a general Q&A assistant on practical business and technical questions.

Metric: Score (%). Source: www.prollm.ai. Status: saturated. 52 models tracked.

Top models

#ModelScore
1O1 Mini98.9
2Grok 498.5
3O398.5
4O3 Mini (High)98.2
5GPT-4.1 Mini97.8
6Gemini 2.5 Pro97.5
7Kimi K297.5
8Grok 396.7
9GPT-4.196.4
10DeepSeek R196.4
11Mistral Large96.4
12O1 Preview96.4
13O3 Mini (Medium)96.4
14GPT-4o95.6
15O195.6

Interactive version: theaggregate.ai/benchmark?slug=prollm-q-a-assistant · How the rankings work · Data refreshed daily, snapshot 2026-07-22.