samantha-1.1-llama-33B: benchmark results
Provider: Other. Access: Open.
Unified ELO 1414 ± 10, rank #2017 of 2928 rated models, from 78 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - TruthfulQA MC1 | 44.43 | Accuracy (%) | 98.6 |
| MMLU-by-task - TruthfulQA MC2 | 61.19 | Accuracy (%) | 97.7 |
| MMLU-by-task - ARC Challenge | 65.02 | Accuracy (%) | 95.7 |
| MMLU-by-task - Abstract Algebra | 37 | Accuracy (%) | 94.5 |
| MMLU-by-task - HellaSwag | 67.64 | Accuracy (%) | 94.4 |
| MMLU-by-task - Virology | 52.41 | Accuracy (%) | 92.8 |
| MMLU-by-task - Sociology | 82.09 | Accuracy (%) | 90.8 |
| MMLU-by-task - High School World History | 82.7 | Accuracy (%) | 90.7 |
| MMLU-by-task - High School Computer Science | 64 | Accuracy (%) | 89.6 |
| MMLU-by-task - Machine Learning | 45.54 | Accuracy (%) | 89.4 |
| MMLU-by-task - Conceptual Physics | 51.49 | Accuracy (%) | 89 |
| MMLU-by-task - Professional Medicine | 59.19 | Accuracy (%) | 89 |
Interactive version: theaggregate.ai/model?slug=samantha-1-1-llama-33b · How It Works · Data refreshed daily, snapshot 2026-09-23.