pfgen-bench - QA Mode - Helpfulness: leaderboard

Metric: Helpfulness Score. Source: github.com. 166 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514) (Thinking)0.91
2Claude 3.5 Sonnet (20240620)0.88
3DeepSeek R10.81
4GPT-4o0.69
5Qwen Max0.68
6Qwen Max (2025-01-25)0.68
7Gemini 1.5 Pro (002)0.66
8GPT-4 Turbo0.63
9Claude 3 Opus (20240229)0.63
10MiniMax-Text-010.61
11Qwen 2.5 72B Instruct0.54
12GPT-40.54
13Gemini 1.5 Flash (002)0.52
14Gemini 2.0 Flash (Preview)0.48
15Claude 3 Sonnet (20240229)0.48

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-qa-mode-helpfulness · How It Works · Data refreshed daily, snapshot 2026-09-19.