Molmo2-CapTest: leaderboard
Metric: Caption F1 (%; LLM-judged statement precision and recall against human captions, 693 videos). Source: arxiv.org. Saturation forecast: Around 2029. 21 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 Mini | 56.6 |
| 2 | GPT-5 | 50.1 |
| 3 | Gemini 2.5 Flash | 46 |
| 4 | Molmo2-8B | 43.2 |
| 5 | Gemini 2.5 Pro | 42.1 |
| 6 | Gemini 3 Pro | 36 |
| 7 | Qwen 3 VL 8B | 26.7 |
| 8 | Claude Sonnet 4.5 | 26 |
| 9 | Qwen 3 VL 4B | 25.2 |
| 10 | GLM-4.1V-9B (Thinking) | 18.4 |
Interactive version: theaggregate.ai/benchmark?slug=molmo2-captest · How It Works · Data refreshed daily, snapshot 2026-09-25.