pythia-6.9B — benchmark results
Provider: EleutherAI. Released 2023-02-14. Access: Open.
Unified ELO 1141 ± 27, rank #1747 of 1776 rated models, from 45 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Classic - Dyck | 65.2 | Exact Match (%) | 73.5 |
| HELM Classic - Entity Matching | 82.42 | Exact Match (%) | 55.3 |
| HELM Classic - bAbI | 47.9 | Exact Match (%) | 50.7 |
| HELM Classic - LegalSupport | 52.15 | Exact Match (%) | 48.5 |
| HELM Classic - MATH Chain-of-Thought | 4.82 | Equivalent (%) | 48.5 |
| OpenEval - IMDb | 93.18 | Exact Match (%) | 47.6 |
| ToolBench - WebShop Long | 0 | Task Score | 44.2 |
| HELM Classic - MATH | 9.1 | Equivalent (%) | 44.1 |
| HELM Classic - LSAT | 19.57 | Exact Match (%) | 43.4 |
| ToolBench - Tabletop | 8.6 | Task Score | 40.7 |
| HELM Classic - IMDB | 92.8 | Exact Match (%) | 40.2 |
| ToolBench - The Cat API | 72 | Task Score | 36 |
Interactive version: theaggregate.ai/model?slug=pythia-6-9b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.