Infinity-Instruct-7M-Gen-Llama3.1-8B — benchmark results
BAAI's SFT-only fine-tune of Llama 3.1 8B on the Infinity-Instruct 7M and Gen datasets, tuned without RLHF. Provider: BAAI. Released 2024-08-02. Access: Open.
Unified ELO 1431 ± 16, rank #1085 of 1776 rated models, from 16 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM Leaderboard | 546.56 | Average Score (%) | 91.7 |
| Open Chinese LLM - GSM8K | 55.34 | Accuracy (%) | 76.1 |
| AlpacaEval 2.0 | 33.92 | LC Win Rate (%) | 73.4 |
| Open LLM Leaderboard - IFEval | 61.32 | Score | 73.4 |
| Open Chinese LLM - WinoGrande | 64.64 | Accuracy (%) | 68 |
| Open Chinese LLM Leaderboard | 58.42 | Average Score (%) | 64.2 |
| Open Chinese LLM - C-Eval Semantic | 73.12 | Accuracy (%) | 61.3 |
| Open LLM Leaderboard - MATH Level 5 | 12.76 | Score | 56.8 |
| Open LLM Leaderboard - BBH | 30.89 | Score | 54.9 |
| Open Chinese LLM - CMMLU | 53.82 | Accuracy (%) | 52.4 |
| Open Chinese LLM - TruthfulQA MC | 53.53 | Accuracy (%) | 49.1 |
| Open LLM Leaderboard - GPQA | 5.7 | Score | 47.8 |
Interactive version: theaggregate.ai/model?slug=infinity-instruct-7m-gen-llama3-1-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.