pfgen-bench - Chat Mode - Fluency: leaderboard

Metric: Fluency Score. Source: github.com. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514) (Thinking)0.97
2MiniMax-Text-010.86
3Qwen 2.5 72B Instruct0.85
4Mistral Large 2 (Nov) Instruct (2411)0.83
5QwQ 32B-Preview0.73
6sarashina2.2-3B-instruct-v0.10.72
7Phi-40.71
8Mistral Small 30.64
9Qwen 2.5 14B Instruct0.64
10Qwen 3 8B (Non-reasoning)0.64
11Qwen 2.5 32B Instruct0.63
12TinySwallow-1.5B-Instruct0.59
13Qwen 2.5 7B Instruct0.54

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-chat-mode-fluency · How It Works · Data refreshed daily, snapshot 2026-09-19.