LLM Trustworthy Leaderboard — leaderboard

DecodingTrust safety evaluation across 8 dimensions: toxicity, stereotypes, adversarial robustness, out-of-distribution, privacy, ethics, and fairness.

Metric: Average Trust Score (%). Source: huggingface.co. Status: saturation imminent. 35 models tracked.

Top models

#ModelScore
1Claude 284.52
2GPT-4o (2024-05-13)82.96
3Llama 3 8B Instruct80.61
4Gemini 1.0 Pro80.61
5GPT-4o Mini (2024-07-18)76.31
6Llama 2 7B Chat74.72
7GPT-3.5 Turbo (0301)72.45
8GPT-4 (0314)69.24
9gemma-2B (IT)67.18
10gemma-7B (IT)66.87
11tulu-2-13B66.51
12tulu-2-7B63.56
13zephyr-7B-beta63.24
14mpt-7B-chat62.29
15vicuna-7B-v1.360.62

Interactive version: theaggregate.ai/benchmark?slug=llm-trustworthy-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.