pfgen-bench - Chat Mode - Score: leaderboard

Metric: pfgen Score (mean of three). Source: github.com. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514) (Thinking)0.95
2MiniMax-Text-010.83
3Qwen 2.5 72B Instruct0.78
4Mistral Large 2 (Nov) Instruct (2411)0.73
5QwQ 32B-Preview0.64
6Qwen 2.5 32B Instruct0.63
7Phi-40.63
8sarashina2.2-3B-instruct-v0.10.62
9Qwen 2.5 14B Instruct0.61
10Qwen 3 8B (Non-reasoning)0.59
11Mistral Small 30.55
12Qwen 2.5 7B Instruct0.5
13TinySwallow-1.5B-Instruct0.49

Interactive version: theaggregate.ai/benchmark?slug=pfgen-bench-chat-mode-score · How It Works · Data refreshed daily, snapshot 2026-09-19.