Insurance Agent Benchmark (Cooper Harness): leaderboard

Metric: Judge Accuracy (%). Source: www.askcooper.ai. 17 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash85.6
2Claude Opus 585.3
3Claude Fable 584.6
4Claude Sonnet 584.4
5Gemini 3.6 Flash83.3
6Gemini 3.7 Flash83.3
7Claude Fable 5.182.3
8Muse Spark 1.382
9Claude Sonnet 4.681.5
10Claude Opus 4.681.5
11GPT-5.6 Terra80.6
12GPT-5.6 Sol80.5
13Gemini 3.1 Pro (Preview)79.6
14Grok 4.678.7
15GPT-5.6 Luna77.7

Interactive version: theaggregate.ai/benchmark?slug=insurance-agent-benchmark-cooper-harness · How It Works · Data refreshed daily, snapshot 2026-09-19.