Infinity-Instruct-3M-0625-Llama3-8B — benchmark results
BAAI's Llama 3 8B tuned on the Infinity-Instruct 3M foundational set plus the 0625 chat stage, SFT-only with no RLHF. Provider: BAAI. Released 2024-07-09. Access: Open.
Unified ELO 1419 ± 17, rank #1137 of 1776 rated models, from 17 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM Leaderboard | 499.9 | Average Score (%) | 87.5 |
| Open Chinese LLM - GSM8K | 57.62 | Accuracy (%) | 80 |
| Open LLM Leaderboard - IFEval | 60.5 | Score | 72.4 |
| BenchBench | 65.38 | Aggregate Score (%) | 69.1 |
| AlpacaEval 2.0 | 27.52 | LC Win Rate (%) | 64.9 |
| Open Chinese LLM Leaderboard | 57.75 | Average Score (%) | 60.8 |
| Open Chinese LLM - C-Eval Semantic | 70.97 | Accuracy (%) | 54.9 |
| Open Chinese LLM - CMMLU | 53.81 | Accuracy (%) | 51.9 |
| Open LLM Leaderboard - BBH | 28.99 | Score | 48.4 |
| Open Chinese LLM - TruthfulQA MC | 53.02 | Accuracy (%) | 45.1 |
| Open LLM Leaderboard - MMLU-Pro | 25.02 | Score | 44.8 |
| Open LLM Leaderboard - MATH Level 5 | 8.84 | Score | 43.7 |
Interactive version: theaggregate.ai/model?slug=infinity-instruct-3m-0625-llama3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.