HELM TORR - Scigen - Robustness: leaderboard

Metric: Robustness (0-100). Source: crfm.stanford.edu. 14 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)93.23
2GPT-4o Mini (2024-07-18)92.77
3DeepSeek V392.56
4Llama 3.1 8B Instruct92.19
5Claude 3.5 Haiku (20241022)91.81
6GPT-4o (2024-11-20)91.76
7Gemini 1.5 Flash (002)89.93
8Llama 3.1 70B Instruct88.79
9Qwen 2 72B Instruct87.71
10Gemini 1.5 Pro (002)87.3
11Mistral 7B Instruct (v0.3)86.85
12Llama 3.1 405B Instruct85.19

Interactive version: theaggregate.ai/benchmark?slug=helm-torr-scigen-robustness · How It Works · Data refreshed daily, snapshot 2026-09-19.