LLM Trustworthy - Adversarial: leaderboard

Metric: Trust Score (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Llama 3 8B Instruct67.28
2Gemini 1.0 Pro67.28
3GPT-4 (0314)64.04
4Claude 257.98
5GPT-3.5 Turbo (0301)56.69
6vicuna-7B-v1.352.16
7GPT-4o (2024-05-13)51.36
8Llama 2 7B Chat51.01
9GPT-4o Mini (2024-07-18)50.25
10Mistral-7B-OpenOrca47.23
11tulu-2-7B44.62
12falcon-7B Instruct43.98
13gemma-7B (IT)43.43
14gemma-2B (IT)43.21
15tulu-2-13B43.14

Interactive version: theaggregate.ai/benchmark?slug=llm-trustworthy-adversarial · How It Works · Data refreshed daily, snapshot 2026-09-05.