OpenExempt: leaderboard

Diagnostic legal benchmark for reasoning over U.S. Bankruptcy Code exemption scenarios.

Metric: Mean F1 (self-reported). Source: benchmarklist.com. Status: saturated. 13 models tracked.

Top models

#ModelScore
1O372.31
2Gemini 2.5 Pro71.71
3GPT-571.67
4Gemini 2.5 Flash65.76
5DeepSeek R164.63
6O4 Mini59.35
7Claude Sonnet 457.37
8GPT-4.147.77
9DeepSeek V347.67
10Llama 4 Maverick40.92
11Claude 3.5 Haiku36.13
12Llama 4 Scout31.91

Interactive version: theaggregate.ai/benchmark?slug=openexempt · How It Works · Data refreshed daily, snapshot 2026-09-05.