PlantMarkerBench: leaderboard

Metric: Valid F1 (self-reported). Source: benchmarklist.com. 51 models tracked.

Top models

#ModelScore
1Qwen 2.5 32B Instruct0.75
2Mistral 7B Instruct0.69
3Qwen 2.5 1.5B Instruct0.67
4GPT-OSS-20B0.67
5Llama 3.2 1B0.67
6Qwen 2.5 7B Instruct0.67
7Qwen 2.5 0.5B0.67
8Llama 3.1 8B0.63
9GPT-5.4 Mini0.63
10GPT-5.40.55
11Qwen 2.5 14B Instruct0.51
12Llama 3.2 3B0.45
13Qwen 2.5 3B Instruct0.25

Interactive version: theaggregate.ai/benchmark?slug=plantmarkerbench · How It Works · Data refreshed daily, snapshot 2026-09-05.