HELM TORR - Tablebench Numerical Reasoning: leaderboard

Metric: ROUGE-L. Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)42.29
2GPT-4o (2024-11-20)39.87
3DeepSeek V335.14
4Gemini 1.5 Pro (002)31.48
5Llama 3.1 405B Instruct31.45
6Llama 3.1 70B Instruct26.53
7GPT-4o Mini (2024-07-18)23.55
8Qwen 2 72B Instruct23.44
9Gemini 1.5 Flash (002)21.04
10Claude 3.5 Haiku (20241022)20.33
11Llama 3.1 8B Instruct9.68
12Mistral 7B Instruct (v0.3)9.65

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-tablebench-numerical-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-08.