Phare: leaderboard

Giskard multilingual safety probe covering hallucination and reliability, social bias, harmful content, sycophancy, prompt sensitivity, and jailbreak resistance.

Metric: Score (%). Source: phare.giskard.ai. 67 models tracked.

Top models

#ModelScore
1Claude Haiku 4.583.16
2Claude Opus 4.582.38
3Claude Sonnet 578.1
4Claude Sonnet 4.577.6
5Claude Opus 4.176.87
6Kimi K2.676.06
7Qwen 3.7 Max75.57
8Claude Opus 4.674.13
9Qwen 3.7 Plus74.06
10Claude Sonnet 4.674.03
11Gemini 3 Pro (Preview)73.31
12GPT-5 Mini73.22
13GPT-5.172.82
14GPT-5.271.03
15Llama 4 Maverick70.84

Interactive version: theaggregate.ai/benchmark?slug=phare · How It Works · Data refreshed daily, snapshot 2026-09-05.