Public Benefits Bench v1: leaderboard

Metric: Score (%). Source: benchmarklist.com. 13 models tracked.

Top models

#ModelScore
1Claude Fable 571.65
2Claude Opus 4.862.11
3MiniMax-M360.69
4Claude Sonnet 4.658.53
5Gemini 3.5 Flash57.98
6GLM-5.157.92
7DeepSeek V4 Pro57.58
8GPT-5.557.24
9Kimi K2.653.38
10Gemini 3.1 Pro (Preview)50.88
11Grok 4.350.07
12Claude Haiku 4.5 (20251001)49.53
13Grok 4.1 Fast (Reasoning)44.32

Interactive version: theaggregate.ai/benchmark?slug=public-benefits-bench-v1 · How It Works · Data refreshed daily, snapshot 2026-09-19.