LLM Trustworthy - Adversarial — leaderboard

Metric: Trust Score (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Llama 3 8B Instruct67.28
2Gemini 1.0 Pro67.28
3GPT-4 (0314)64.04
4Claude 257.98
5GPT-3.5 Turbo (0301)56.69
6vicuna-7B-v1.352.16
7GPT-4o (2024-05-13)51.36
8Llama 2 7B Chat51.01
9GPT-4o Mini (2024-07-18)50.25
10Mistral-7B-OpenOrca47.23
11mpt-7B-chat46.2
12RedPajama-INCITE-7B-Instruct44.81
13tulu-2-7B44.62
14falcon-7B Instruct43.98
15gemma-7B (IT)43.43

Interactive version: theaggregate.ai/benchmark?slug=llm-trustworthy-adversarial · How the rankings work · Data refreshed daily, snapshot 2026-07-22.