FinSkillBench (Self-Generated Skills): leaderboard

Metric: Task score (0-1, native; the agent writes and reuses its own skill documents within each episode; over FinSkillBench's 12 investment-management subtasks (portfolio construction, risk management, fundamental analysis), unweighted mean, hidden ground truth and task-specific verifiers). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.60.49
2DeepSeek V3.20.45
3Gemini 3.1 Flash Lite0.43
4Gemini 2.5 Pro0.41
5GPT-5.40.41
6GPT-4.10.4
7GLM-5.10.25
8Grok 40.14
9Phi-40

Interactive version: theaggregate.ai/benchmark?slug=finskillbench-self-generated-skills · How It Works · Data refreshed daily, snapshot 2026-09-26.