Infinity-Instruct-7M-Gen-Llama3.1-8B: benchmark results

BAAI's SFT-only fine-tune of Llama 3.1 8B on the Infinity-Instruct 7M and Gen datasets, tuned without RLHF. Provider: BAAI. Released 2024-08-02. Access: Open.

Unified ELO 1495 ± 1, rank #716 of 1392 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard45.74Average Score (%)92.1
Open Chinese LLM - GSM8K55.34Accuracy (%)76.1
AlpacaEval 2.033.92LC Win Rate (%)73.4
Open LLM Leaderboard - IFEval61.32Score73.4
Open Chinese LLM - WinoGrande64.64Accuracy (%)68
Open Chinese LLM Leaderboard58.42Average Score (%)64.2
Open Chinese LLM - C-Eval Semantic73.12Accuracy (%)61.3
Open LLM Leaderboard - MATH Level 512.76Score56.7
Open LLM Leaderboard - BBH30.89Score54.9
Open Chinese LLM - CMMLU53.82Accuracy (%)52.4
Open Chinese LLM - TruthfulQA MC53.53Accuracy (%)49.1
Open LLM Leaderboard - GPQA5.7Score47.8

Interactive version: theaggregate.ai/model?slug=infinity-instruct-7m-gen-llama3-1-8b · How It Works · Data refreshed daily, snapshot 2026-09-05.