HELM TORR - Tablebench Numerical Reasoning - Robustness: leaderboard

Metric: Robustness (0-100). Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1Mistral 7B Instruct (v0.3)71.09
2Llama 3.1 8B Instruct65.54
3Qwen 2 72B Instruct55.4
4GPT-4o Mini (2024-07-18)54.92
5Gemini 1.5 Flash (002)54.45
6Claude 3.5 Haiku (20241022)54.07
7GPT-4o (2024-11-20)51.12
8Llama 3.1 405B Instruct50.7
9Gemini 1.5 Pro (002)50.65
10Llama 3.1 70B Instruct49.2
11Claude 3.5 Sonnet (20241022)43.54
12DeepSeek V342.62

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-tablebench-numerical-reasoning-robustness · How It Works · Data refreshed daily, snapshot 2026-09-19.