pfgen-bench - QA Mode - Fluency: leaderboard

Metric: Fluency Score. Source: github.com. 166 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514) (Thinking)1
2Claude 3.5 Sonnet (20240620)0.95
3GPT-4o0.92
4Claude 3 Opus (20240229)0.91
5GPT-40.89
6Qwen 2.5 72B Instruct0.87
7Qwen Max (2025-01-25)0.86
8Qwen Max0.86
9MiniMax-Text-010.85
10DeepSeek R10.84
11Gemini 1.5 Pro (002)0.83
12Mistral Large 2 (Nov) Instruct (2411)0.82
13GPT-4 Turbo0.82
14sarashina2.2-3B-instruct-v0.10.81
15Claude 3 Sonnet (20240229)0.81

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-qa-mode-fluency · How It Works · Data refreshed daily, snapshot 2026-09-19.