OPT-66B: benchmark results
Provider: Meta. Released 2022-06-22. Access: Open.
Unified ELO 1215 ± 53, rank #2620 of 2656 rated models, from 40 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Classic - MS MARCO TREC | 48.2 | NDCG@10 (%) | 70 |
| HELM Classic - Synthetic Reasoning Natural | 21.29 | F1 (%) | 63.2 |
| HELM Classic - BLiMP | 82.67 | Exact Match (%) | 61.3 |
| HELM Classic - XSUM | 12.62 | ROUGE-2 (%) | 61 |
| HELM Classic - BoolQ | 76.03 | Exact Match (%) | 56.1 |
| HELM Classic - MS MARCO Regular | 23.71 | RR@10 (%) | 55.2 |
| HELM Classic - HellaSwag | 74.5 | Exact Match (%) | 54.8 |
| HELM Classic - LegalSupport | 52.69 | Exact Match (%) | 52.9 |
| HELM Classic - QuAC | 35.66 | F1 (%) | 50.8 |
| HELM Classic - CNN/DailyMail | 13.6 | ROUGE-2 (%) | 48.8 |
| HELM Classic - OpenbookQA | 53.4 | Exact Match (%) | 48.4 |
| HELM Classic - NaturalQuestions Closed Book | 25.79 | F1 (%) | 47 |
Interactive version: theaggregate.ai/model?slug=opt-66b · How It Works · Data refreshed daily, snapshot 2026-09-19.