Insurance Agent Benchmark (Model Alone): leaderboard

Metric: Judge Accuracy (%). Source: www.askcooper.ai. 17 models tracked.

Top models

#ModelScore
1Grok 4.677.6
2GPT-5.6 Terra76.8
3GPT-5.6 Sol76.7
4Gemini 3.7 Flash76.7
5GPT-5.6 Luna76.5
6Gemini 3.8 Flash75.9
7Gemini 3.6 Flash74.9
8Gemini 3.1 Pro (Preview)74.6
9Claude Opus 573.4
10Gemini 3.5 Flash Lite73.2
11Claude Fable 5.172.9
12Claude Sonnet 571.7
13Claude Fable 570.7
14Claude Opus 4.670.6
15Claude Sonnet 4.669.6

Interactive version: theaggregate.ai/benchmark?slug=insurance-agent-benchmark-model-alone · How It Works · Data refreshed daily, snapshot 2026-09-19.