HELM TORR - Tablebench Data Analysis - Robustness: leaderboard

Metric: Robustness (0-100). Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1DeepSeek V372.88
2GPT-4o (2024-11-20)72.16
3Qwen 2 72B Instruct69.74
4GPT-4o Mini (2024-07-18)69.65
5Claude 3.5 Sonnet (20241022)68.63
6Gemini 1.5 Flash (002)66.6
7Gemini 1.5 Pro (002)66.27
8Mistral 7B Instruct (v0.3)66.06
9Claude 3.5 Haiku (20241022)65.97
10Llama 3.1 70B Instruct64.21
11Llama 3.1 405B Instruct63.56
12Llama 3.1 8B Instruct57.74

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-tablebench-data-analysis-robustness · How It Works · Data refreshed daily, snapshot 2026-09-19.