OLMo 3 7B (Thinking) — benchmark results

OLMo 3 7B evaluated with thinking enabled. Provider: Allen AI. Released 2025-11-20. Access: Open.

Unified ELO 1447 ± 10, rank #1011 of 1776 rated models, from 332 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval French NLU - Eltec76.8Named entity recognition Score (%)98.9
EuroEval English NLU - CoNLL EN81.75Named entity recognition Score (%)88.6
EuroEval Polish NLU - KPWr NER64.76Named entity recognition Score (%)87.6
EuroEval Ukrainian NLU - NER UK68.71Named entity recognition Score (%)86.2
EuroEval Hungarian NLU - Szeged NER71.37Named entity recognition Score (%)84.2
EuroEval Spanish NLU - CoNLL ES73.11Named entity recognition Score (%)83.9
EuroEval Portuguese NLU - HAREM51.69Named entity recognition Score (%)80.9
EuroEval Portuguese NLU - ScaLA PT25.37Linguistic acceptability Score (%)80
EuroEval Norwegian NLU - NorNE NB75.14Named entity recognition Score (%)78.2
EuroEval Dutch NLU - CoNLL NL65.41Named entity recognition Score (%)77.6
EuroEval Bosnian50.8Average Score (%)75.2
EuroEval Catalan NLU - WikiANN CA68.1Named entity recognition Score (%)73.5

Interactive version: theaggregate.ai/model?slug=olmo-3-7b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.