CliniCARE-Bench - Verdict Macro-F1: leaderboard

Metric: Macro-F1 over the four verdict classes (0-1). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Claude Code + Claude Opus 50.7
2Codex + GPT-5.50.7
3Codex + GPT-5.6 Sol0.66
4Gemini CLI + Gemini 3.1 Pro0.66
5Claude Code + Claude Sonnet 50.65
6Gemini CLI + Gemini 3.6 Flash0.65
7OpenCode + GLM 5.20.64
8Codex + GPT-5.40.63
9Gemini CLI + Gemini 3.5 Flash0.62
10OpenCode + DeepSeek V4 Pro0.61

Interactive version: theaggregate.ai/benchmark?slug=clinicare-bench-verdict-macro-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.