pfgen-bench - QA Mode - Score: leaderboard

Metric: pfgen Score (mean of three). Source: github.com. 166 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514) (Thinking)0.96
2Claude 3.5 Sonnet (20240620)0.93
3GPT-4o0.86
4DeepSeek R10.86
5Qwen Max (2025-01-25)0.84
6Qwen Max0.84
7Claude 3 Opus (20240229)0.83
8Gemini 1.5 Pro (002)0.82
9MiniMax-Text-010.82
10GPT-4 Turbo0.8
11GPT-40.79
12Qwen 2.5 72B Instruct0.78
13Gemini 1.5 Flash (002)0.74
14Claude 3 Sonnet (20240229)0.73
15Gemini 2.0 Flash (Preview)0.73

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-qa-mode-score · How It Works · Data refreshed daily, snapshot 2026-09-19.