OenoBench (Expert): leaderboard

Metric: Accuracy (%, L4 expert tier). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1O371.2
2Gemini 2.5 Pro (Thinking)69.4
3GPT-569.2
4Claude Opus 4.769.1
5Claude Opus 4.7 (Thinking)68.6
6Gemini 2.5 Pro68.5
7GPT-5 Mini64.8
8DeepSeek R162.1
9Gemini 2.5 Flash60.1
10Mistral Large 2 (Nov) Instruct (2411)54
11DeepSeek V352.4
12Qwen 2.5 72B51.4
13Llama 3.3 70B50.3
14Llama 3.1 8B45
15Qwen 2.5 7B43.3

Interactive version: theaggregate.ai/benchmark?slug=oenobench-expert · How It Works · Data refreshed daily, snapshot 2026-09-05.