HELM VHELM - Bingo Multilinguality: leaderboard

Metric: Prometheus Vision rating. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)4.59
2O3 (2025-04-16)4.52
3O4 Mini (2025-04-16)4.23
4O1 (2024-12-17)3.9
5GPT-4o (2024-11-20)3.49
6Gemini 2.0 Pro (Preview 02-05)3.44
7GPT-4.53.38
8Claude 3.5 Sonnet (20240620)3.29
9GPT-4o (2024-08-06)3.22
10Claude 3.5 Sonnet (20241022)3.18
11GPT-4o (2024-05-13)3.18
12Gemini 1.5 Flash (002)3.16
13GPT-4o Mini (2024-07-18)3.16
14GPT-4.1 (2025-04-14)3.12
15GPT-4.1 Mini3.07

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-bingo-multilinguality · How It Works · Data refreshed daily, snapshot 2026-09-08.