MM-MT-Bench: leaderboard

92 image-grounded conversations (69 single-turn, 23 multi-turn) over charts, tables, PDF pages and diagrams from Mistral AI (2024); a GPT-4o judge rates correctness and completeness from 1 to 10.

Source: arxiv.org.

Interactive version: theaggregate.ai/benchmark?slug=mm-mt-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.