OpenSkillRisk: leaderboard

Metric: Overall (%). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1GPT-5.493.05
2Claude Sonnet 4.692.08
3Claude Opus 4.691.71
4GPT-5.3 Codex90.5
5Gemini 3.1 Pro (Preview)89.12
6GLM-5.188.84
7Kimi K2.666.86
8Claude Haiku 4.564.13
9Gemini 3 Flash56.29
10DeepSeek V4 Pro53.45
11DeepSeek V3.248.76
12GPT-5.1 Codex Mini43.69
13Gemini 2.5 Pro13.43

Interactive version: theaggregate.ai/benchmark?slug=openskillrisk · How It Works · Data refreshed daily, snapshot 2026-09-05.