GRACE - LogiQA Categorization: leaderboard

Metric: Four-class error-categorization macro-F1 (%) on LogiQA inference traces; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 10 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)78.77
2Gemini 3 Flash59.17
3GPT-5.452.18
4Gemma 4 31B52.02
5Qwen 3.5 27B44.27
6Qwen 3.5 35B A3B37.04
7GPT-5.4 Mini33.71
8Llama 3.1 8B32.05
9Qwen 3 14B25.19
10Qwen 3 8B16.43

Interactive version: theaggregate.ai/benchmark?slug=grace-logiqa-categorization · How It Works · Data refreshed daily, snapshot 2026-09-29.