Finance Agents Benchmark: leaderboard
Metric: Task pass rate (%) over 50 due-diligence tasks x 3 trials; a task passes only when every rubric criterion passes (GPT-6 Luna judge). Source: github.com. Saturation forecast: Around September 2027. 4 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-6 Sol (Medium) | 58.7 |
| 2 | GPT-6 Luna (Medium) | 50.7 |
Interactive version: theaggregate.ai/benchmark?slug=finance-agents-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-29.