HELM TORR - Tablebench Data Analysis: leaderboard

Metric: ROUGE-L. Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)32.99
2DeepSeek V331.49
3Claude 3.5 Sonnet (20241022)30.94
4Llama 3.1 405B Instruct29.91
5Llama 3.1 70B Instruct29.61
6Gemini 1.5 Pro (002)28.57
7Gemini 1.5 Flash (002)28.14
8Qwen 2 72B Instruct26.92
9GPT-4o Mini (2024-07-18)26.45
10Claude 3.5 Haiku (20241022)23.12
11Mistral 7B Instruct (v0.3)21.91
12Llama 3.1 8B Instruct15.84

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-tablebench-data-analysis · How It Works · Data refreshed daily, snapshot 2026-09-08.