Llama-3.1-Argunaut-1-8B-SFT: benchmark results
Provider: Meta. Released 2024-12-31. Access: Open.
Unified ELO 1449 ± 1, rank #950 of 1392 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 15.85 | Score | 84.1 |
| Open LLM Leaderboard - IFEval | 55.19 | Score | 66.7 |
| Open LLM Leaderboard - MATH Level 5 | 14.5 | Score | 60.9 |
| Open CoT - LSAT Reading Comprehension | 13.75 | CoT Gain (%) | 57.6 |
| Open LLM Leaderboard - MMLU-Pro | 27.47 | Score | 50.6 |
| Open LLM Leaderboard - BBH | 27.19 | Score | 43.1 |
| Open CoT - LSAT Analytical Reasoning | 3.04 | CoT Gain (%) | 41.2 |
| Open LLM Leaderboard - GPQA | 4.47 | Score | 38.5 |
| Open CoT Leaderboard | 4.6 | Average CoT Gain (%) | 28.2 |
| Open CoT - LSAT Logical Reasoning | 3.92 | CoT Gain (%) | 17.9 |
| Open CoT - LogiQA | 1.44 | CoT Gain (%) | 17.2 |
| Open CoT - LogiQA 2 | 0.83 | CoT Gain (%) | 10.7 |
Interactive version: theaggregate.ai/model?slug=llama-3-1-argunaut-1-8b-sft · How It Works · Data refreshed daily, snapshot 2026-09-05.