Finetuning with Scientific Data Increases Hall — leaderboard

Metric: OFS (self-reported). Source: benchmarklist.com. 18 models tracked.

Top models

#ModelScore
1Qwen 3 8B67.1
2Qwen 2.5 14B Instruct66.7
3GPT-4o Mini66.1
4Qwen 3 32B66
5Qwen 2.5 7B Instruct65.2
6Llama 3.1 8B Instruct65
7tulu-2-7B62.7
8Llama 2 70B Chat62.2
9Llama 2 7B Chat61.4
10Sonar58

Interactive version: theaggregate.ai/benchmark?slug=finetuning-with-scientific-data-increases-hall · How the rankings work · Data refreshed daily, snapshot 2026-07-22.