OLMo 3 7B (Thinking) — benchmark results
OLMo 3 7B evaluated with thinking enabled. Provider: Allen AI. Released 2025-11-20. Access: Open.
Unified ELO 1447 ± 10, rank #1011 of 1776 rated models, from 332 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval French NLU - Eltec | 76.8 | Named entity recognition Score (%) | 98.9 |
| EuroEval English NLU - CoNLL EN | 81.75 | Named entity recognition Score (%) | 88.6 |
| EuroEval Polish NLU - KPWr NER | 64.76 | Named entity recognition Score (%) | 87.6 |
| EuroEval Ukrainian NLU - NER UK | 68.71 | Named entity recognition Score (%) | 86.2 |
| EuroEval Hungarian NLU - Szeged NER | 71.37 | Named entity recognition Score (%) | 84.2 |
| EuroEval Spanish NLU - CoNLL ES | 73.11 | Named entity recognition Score (%) | 83.9 |
| EuroEval Portuguese NLU - HAREM | 51.69 | Named entity recognition Score (%) | 80.9 |
| EuroEval Portuguese NLU - ScaLA PT | 25.37 | Linguistic acceptability Score (%) | 80 |
| EuroEval Norwegian NLU - NorNE NB | 75.14 | Named entity recognition Score (%) | 78.2 |
| EuroEval Dutch NLU - CoNLL NL | 65.41 | Named entity recognition Score (%) | 77.6 |
| EuroEval Bosnian | 50.8 | Average Score (%) | 75.2 |
| EuroEval Catalan NLU - WikiANN CA | 68.1 | Named entity recognition Score (%) | 73.5 |
Interactive version: theaggregate.ai/model?slug=olmo-3-7b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.