Open FinLLM Leaderboard: leaderboard

Open financial-language-model leaderboard from FINOS, covering broad financial NLP and reasoning task categories.

Metric: Average normalized score (self-reported). Source: benchmarklist.com. Status: saturated. 22 models tracked.

Top models

#ModelScore
1plutus-8B-instruct55.9
2GPT-448.34
3Qwen 2.5 32B Instruct42.49
4Qwen 2.5 72B Instruct41.36
5GPT-4o37.51
6Llama 3 70B Instruct31.23
7DeepSeek V3 Chat29.49
8GPT-4o Mini28.32
9GPT-3.5 Turbo (0125)23.16
10Llama 3.1 8B Instruct22.72
11Gemma 2 27B (IT)19.81
12Llama 3 8B Instruct18.93
13Qwen 2.5 7B Instruct17.37
14Mistral 7B Instruct (v0.3)14.68
15Gemma 2 9B (IT)14.32

Interactive version: theaggregate.ai/benchmark?slug=open-finllm-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.