Fin-Bias — leaderboard

Metric: Average Herding Score (with rating) (self-reported). Source: benchmarklist.com. 19 models tracked.

Top models

#ModelScore
1Qwen 3 8B98.3
2GLM-4 9B Chat98.1
3gemma-7B (IT)97.6
4Gemma 2 27B97.5
5Claude 3.5 Haiku97.1
6Gemma 2 9B (IT)97
7GPT-495.9
8GPT-594.6
9Llama 3.1 8B IT92.4
10Mistral Nemo Instruct (2407)90.8
11Claude Sonnet 490.6
12internlm2-chat-7B89.1
13Yi-1.5-9B-Chat-16K83.4

Interactive version: theaggregate.ai/benchmark?slug=fin-bias · How the rankings work · Data refreshed daily, snapshot 2026-07-22.