MEGA-Bench Task - Booking Web Recommendation: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o78
2Claude 3.5 Sonnet (20240620)76.2
3Gemini 2.5 Pro (Preview 03-25)74.2
4GPT-4o Mini70.6
5Gemini 1.5 Pro (002)67.7
6Claude 3.5 Sonnet (20241022)67.5
7InternVL2.5-78B63.1
8Gemini 1.5 Flash (002)62
9Pixtral-12B59.9
10Gemma 3 12B (IT)55.3
11Gemma 3 27B (IT)54
12Llama 4 Scout Base48.3
13Gemma 3 4B (IT)48.1
14Qwen 2 VL 72B47.9
15Qwen 2 VL 2B47.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-booking-web-recommendation · How It Works · Data refreshed daily, snapshot 2026-09-05.