HELM VHELM - Vqa Dialect: leaderboard

Metric: PEM (Fairness). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash (Preview)83.4
2GPT-4.583.4
3GPT-4o (2024-05-13)83
4Gemini 2.0 Flash Lite81
5Gemini 1.5 Flash (002)80.6
6GPT-4.1 (2025-04-14)80.6
7GPT-4o (2024-08-06)80.5
8O3 (2025-04-16)80.4
9GPT-4.1 Mini80.3
10Gemini 2.0 Flash Lite (Preview 02-05)79.9
11Gemini 2.0 Flash79.4
12Gemini 1.5 Pro (002)79.3
13GPT-4o (2024-11-20)79.2
14Llama 4 Scout Instruct78.9
15Gemini 2.5 Pro (Preview 03-25)78.4

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-vqa-dialect · How It Works · Data refreshed daily, snapshot 2026-09-08.