Molmo2-8B: benchmark results
Provider: Allen AI. Released 2025-03-13. Access: Open.
Unified ELO 1476 ± 1, rank #806 of 1392 rated models, from 50 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| GQA | 87.07 | Overall Accuracy (%) | 99.8 |
| CringeBench | 0.63 | Cringe Score (0-10, lower is better) | 90.9 |
| AA Omniscience - Software Engineering (SWE) - Dart | 18 | Accuracy (%) | 51.5 |
| Chatbot Arena (Text - Hard Prompts) | 1339 | Arena Score | 43.1 |
| AA Omniscience - Software Engineering (SWE) - PHP | 18 | Accuracy (%) | 43 |
| Chatbot Arena (Text) | 1328 | Elo | 42.1 |
| Chatbot Arena (Text - Instruction Following) | 1310 | Arena Score | 40.2 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 14 | Accuracy (%) | 39.8 |
| Chatbot Arena (Text - English) | 1340 | Arena Score | 39.3 |
| AA Omniscience - Software Engineering (SWE) - HTML | 26 | Accuracy (%) | 36 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 22.73 | Accuracy (%) | 32.8 |
| AA Omniscience - Software Engineering (SWE) - Python | 13 | Accuracy (%) | 29.9 |
Interactive version: theaggregate.ai/model?slug=molmo2-8b · How It Works · Data refreshed daily, snapshot 2026-09-05.