KOFFVQA — leaderboard

Korean Open-ended Free-form VQA benchmark: 82 vision-language models evaluated on object recognition, document/table/chart understanding, OCR, and commonsense reasoning in Korean.

Metric: Overall Score (%). Source: huggingface.co. Status: saturated. 82 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (03-25)89.67
2Gemini 2.5 Flash (Preview 04-17)89.53
3Gemini 2.5 Pro (Preview 05-06)88.98
4O3 (2025-04-16)88.29
5O1 (2024-12-17)88.25
6O4 Mini (2025-04-16)87.85
7Gemini 2.5 Flash (Preview 05-20)86.76
8GPT-4.1 Mini85.82
9GPT-4.185.71
10GPT-4.5 (Preview)85.31
11GPT-4o (2024-11-20)81.96
12Claude 3.5 Sonnet (20241022)80.47
13Llama 4 Scout Instruct79.93
14Gemini 2.0 Flash (001)79.09
15Gemini 2.0 Flash (Preview)78.87

Interactive version: theaggregate.ai/benchmark?slug=koffvqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.