FinSkillBench (No-Skill): leaderboard

Metric: Task score (0-1, native; unweighted mean subtask score with no skill corpus or finance tools available; over FinSkillBench's 12 investment-management subtasks (portfolio construction, risk management, fundamental analysis), unweighted mean, hidden ground truth and task-specific verifiers). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.60.53
2DeepSeek V3.20.46
3GPT-5.40.43
4Gemini 3.1 Flash Lite0.42
5Gemini 2.5 Pro0.38
6GPT-4.10.33
7GLM-5.10.27
8Grok 40.1
9Phi-40

Interactive version: theaggregate.ai/benchmark?slug=finskillbench-no-skill · How It Works · Data refreshed daily, snapshot 2026-09-26.