CliniCARE-Bench - Expected Calibration Error: leaderboard

Metric: Expected calibration error (0-1; lower is better). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Claude Code + Claude Sonnet 50.05
2Claude Code + Claude Opus 50.06
3Codex + GPT-5.50.09
4OpenCode + GLM 5.20.13
5Codex + GPT-5.40.15
6OpenCode + Kimi K2.7 Code0.16
7OpenCode + Qwen 3.7 Plus0.19
8OpenCode + MiniMax M30.19
9OpenCode + DeepSeek V4 Pro0.19
10Codex + GPT-5.6 Sol0.19

Interactive version: theaggregate.ai/benchmark?slug=clinicare-bench-expected-calibration-error · How It Works · Data refreshed daily, snapshot 2026-09-19.