FrontierFinance - Coverage & Catalyst Monitoring: leaderboard

Metric: Rubric qualification rate (%, macro average over queries, three-judge majority vote). Source: research.samaya.ai. Saturation forecast: Around 2029. 11 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (High)53.72
2Claude Fable 5 (High)49.01
3Kimi K3 (Max)46.87
4GPT-5.6 Sol (Medium)46.73
5GLM-5.2 (Max)46.36
6Claude Opus 4.8 (High)43.19
7GPT-5.5 (Medium)41.51
8DeepSeek V4 Pro (High)38.45
9Gemini 3.6 Flash (Medium)36.47
10Kimi K2.628.37
11Gemini 3.1 Pro (Preview) (High)27.43

Interactive version: theaggregate.ai/benchmark?slug=frontierfinance-coverage-catalyst-monitoring · How It Works · Data refreshed daily, snapshot 2026-09-26.