Grip on LLMs - HonestCityBench - Narrow Expertise: leaderboard

Metric: Appropriate acknowledgement rate (%; LLM judge). Source: arxiv.org. 31 models tracked.

Top models

#ModelScore
1Gemma 3 12B (IT)12
2Llama 3.1 8B Instruct8
3Gemma 3 27B (IT)5
4GEITje-7B-ultra5
5GPT-4o4
6GPT-5 Mini4
7SmolLM3-3B3
8GPT-51
9GPT-4o Mini1
10GPT-OSS-20B1
11Mistral 7B Instruct (v0.3)1
12Qwen 3 8B1
13Qwen 3 32B1
14Mistral Large 31
15Phi-4 Mini Instruct1

Interactive version: theaggregate.ai/benchmark?slug=grip-on-llms-honestcitybench-narrow-expertise · How It Works · Data refreshed daily, snapshot 2026-09-19.