pfgen-bench - QA Mode - Truthfulness: leaderboard

Metric: Truthfulness Score. Source: github.com. 166 models tracked.

Top models

#ModelScore
1MiniMax-Text-010.99
2GPT-4o0.98
3Gemini 2.0 Flash (Preview)0.98
4Gemini 1.5 Pro (002)0.98
5Claude Opus 4 (20250514) (Thinking)0.97
6Qwen Max (2025-01-25)0.97
7Qwen Max0.96
8Gemini 1.5 Flash (002)0.96
9Claude 3.5 Sonnet (20240620)0.96
10GPT-4 Turbo0.96
11GPT-40.95
12Claude 3 Opus (20240229)0.94
13Claude 3 Haiku (20240307)0.94
14Qwen 2.5 72B Instruct0.94
15c4ai-command-r-plus0.93

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-qa-mode-truthfulness · How It Works · Data refreshed daily, snapshot 2026-09-19.