HELM TORR - Qtsumm - Robustness: leaderboard

Metric: Robustness (0-100). Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)79.31
2Claude 3.5 Sonnet (20241022)78.96
3GPT-4o Mini (2024-07-18)78.71
4Qwen 2 72B Instruct77.49
5DeepSeek V377.42
6Claude 3.5 Haiku (20241022)76.93
7Llama 3.1 70B Instruct75.39
8Gemini 1.5 Pro (002)73.47
9Llama 3.1 405B Instruct72.85
10Mistral 7B Instruct (v0.3)72.09
11Llama 3.1 8B Instruct65.76
12Gemini 1.5 Flash (002)60.32

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-qtsumm-robustness · How It Works · Data refreshed daily, snapshot 2026-09-19.