GRACE - LogiQA: leaderboard

Metric: Step-level faithful/unfaithful F1 (%) on LogiQA inference traces; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 10 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)83.28
2Gemma 4 31B76.69
3Qwen 3.5 27B75.76
4Gemini 3 Flash73.65
5GPT-5.473.2
6Qwen 3.5 35B A3B71.12
7GPT-5.4 Mini59.69
8Qwen 3 14B49.04
9Qwen 3 8B42.06
10Llama 3.1 8B41.96

Interactive version: theaggregate.ai/benchmark?slug=grace-logiqa · How It Works · Data refreshed daily, snapshot 2026-09-29.