SynthPAI — leaderboard
Metric: Average accuracy in %. Source: huggingface.co. 18 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4 | 77.9 |
| 2 | Llama 3 70B | 72.2 |
| 3 | Mixtral 8x22B | 72 |
| 4 | Claude 3 Opus | 71.1 |
| 5 | Claude 3 Sonnet | 70.9 |
| 6 | Gemini 1.5 Pro | 67.5 |
| 7 | Qwen 1.5 110B | 65.7 |
| 8 | Gemini 1.0 Pro | 64.6 |
| 9 | Claude 3 Haiku | 64 |
| 10 | Yi 34B (Chat) | 57.7 |
| 11 | Llama 2 70B | 56.8 |
| 12 | GPT-3.5 | 55.9 |
| 13 | Llama 3 8B | 53.5 |
| 14 | Mixtral 8x7B | 52.3 |
| 15 | Llama 2 13B | 48.7 |
Interactive version: theaggregate.ai/benchmark?slug=synthpai · How the rankings work · Data refreshed daily, snapshot 2026-07-22.