Infinity-Instruct-7M-Gen-Llama3.1-8B — benchmark results

BAAI's SFT-only fine-tune of Llama 3.1 8B on the Infinity-Instruct 7M and Gen datasets, tuned without RLHF. Provider: BAAI. Released 2024-08-02. Access: Open.

Unified ELO 1431 ± 16, rank #1085 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard546.56Average Score (%)91.7
Open Chinese LLM - GSM8K55.34Accuracy (%)76.1
AlpacaEval 2.033.92LC Win Rate (%)73.4
Open LLM Leaderboard - IFEval61.32Score73.4
Open Chinese LLM - WinoGrande64.64Accuracy (%)68
Open Chinese LLM Leaderboard58.42Average Score (%)64.2
Open Chinese LLM - C-Eval Semantic73.12Accuracy (%)61.3
Open LLM Leaderboard - MATH Level 512.76Score56.8
Open LLM Leaderboard - BBH30.89Score54.9
Open Chinese LLM - CMMLU53.82Accuracy (%)52.4
Open Chinese LLM - TruthfulQA MC53.53Accuracy (%)49.1
Open LLM Leaderboard - GPQA5.7Score47.8

Interactive version: theaggregate.ai/model?slug=infinity-instruct-7m-gen-llama3-1-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.