Horangi 4 - Ko-TruthfulQA: leaderboard

Metric: Accuracy (%). Source: horangi.ai. 105 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)98
2Claude Fable 5 (High)98
3GPT-5.5 (xHigh)96
4Claude Opus 4.8 (High)96
5Claude Sonnet 4.5 (High)96
6Qwen 3.7 Max95
7Grok 4.595
8Claude Sonnet 5 (High)95
9Claude Opus 4.5 (20251101) (High)95
10Gemini 3.5 Flash93
11Gemini 3 Pro (Preview) (High)93
12Gemini 3 Flash (Preview)92
13Grok 4.2092
14GPT-5.6 Terra (Max)92
15GLM-5-Turbo92

Interactive version: theaggregate.ai/benchmark?slug=horangi-4-ko-truthfulqa · How It Works · Data refreshed daily, snapshot 2026-09-19.