Molmo2-8B: benchmark results

Provider: Allen AI. Released 2025-03-13. Access: Open.

Unified ELO 1476 ± 1, rank #806 of 1392 rated models, from 50 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
GQA87.07Overall Accuracy (%)99.8
CringeBench0.63Cringe Score (0-10, lower is better)90.9
AA Omniscience - Software Engineering (SWE) - Dart18Accuracy (%)51.5
Chatbot Arena (Text - Hard Prompts)1339Arena Score43.1
AA Omniscience - Software Engineering (SWE) - PHP18Accuracy (%)43
Chatbot Arena (Text)1328Elo42.1
Chatbot Arena (Text - Instruction Following)1310Arena Score40.2
AA Omniscience - Software Engineering (SWE) - Kotlin14Accuracy (%)39.8
Chatbot Arena (Text - English)1340Arena Score39.3
AA Omniscience - Software Engineering (SWE) - HTML26Accuracy (%)36
AA Omniscience - Software Engineering (SWE) - JavaScript22.73Accuracy (%)32.8
AA Omniscience - Software Engineering (SWE) - Python13Accuracy (%)29.9

Interactive version: theaggregate.ai/model?slug=molmo2-8b · How It Works · Data refreshed daily, snapshot 2026-09-05.