ELBench - Safety and Trustworthiness: leaderboard

Metric: Module score (%; mean per-item score on 1,000 items: synthesized refusal, safe-guidance and benign-answering requests and curated EduGuardBench teaching-safety and jailbreak items; zero-shot, temperature 0; open-ended items scored by a Qwen3.6 rubric judge, majority of 9 calls). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1DeepSeek V4 Flash89.7
2GLM-5.189.5
3DeepSeek V4 Pro86.1
4Seed 2.0 Pro83
5Claude Opus 4.878.5
6GPT-5.476.6
7Gemini 3.5 Flash70.2

Interactive version: theaggregate.ai/benchmark?slug=elbench-safety-and-trustworthiness · How It Works · Data refreshed daily, snapshot 2026-09-29.