FrontierFinance: leaderboard

Metric: Rubric qualification rate (%, macro average over queries, three-judge majority vote). Source: research.samaya.ai. Saturation forecast: Around 2029. 11 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (High)55.86
2Claude Fable 5 (High)49.19
3GPT-5.6 Sol (Medium)46.83
4Kimi K3 (Max)46.37
5Gemini 3.6 Flash (Medium)46.27
6Claude Opus 4.8 (High)45.04
7GPT-5.5 (Medium)43.47
8GLM-5.2 (Max)42.77
9DeepSeek V4 Pro (High)40.54
10Kimi K2.632.32
11Gemini 3.1 Pro (Preview) (High)30.51

Interactive version: theaggregate.ai/benchmark?slug=frontierfinance · How It Works · Data refreshed daily, snapshot 2026-09-26.