TaxEval v2: leaderboard

A Vals-created set of questions and responses to tax questions.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturation imminent. 145 models tracked.

Top models

#ModelScore
1Muse Spark 1.2 (xHigh)80.38
2Muse Spark 1.1 (xHigh)79.72
3Muse Spark77.68
4Claude Sonnet 4.6 (Max)77.11
5Claude Fable 5 (Max)76.94
6GPT-5.6 Terra (xHigh)76.17
7GPT-5.6 Luna (Max)76.17
8Claude Fable 5.1 (Max)75.96
9Claude Opus 4.6 (Adaptive Reasoning, Max Effort)75.96
10Grok 375.88
11GPT-5.2 (xHigh)75.76
12Kimi K375.72
13Grok 4 Fast (Reasoning)75.7
14Claude Opus 4.8 (Max)75.63
15Claude Sonnet 5 (Max)75.63

Interactive version: theaggregate.ai/benchmark?slug=taxeval-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.