Tess-2.0-Llama-3-70B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1574 ± 16, rank #761 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU79.75Accuracy (%) (5-shot)99.5
Open LLM Leaderboard v1 - GSM8K74.6Accuracy (%) (5-shot)99.1
Open LLM Leaderboard v1 - WinoGrande85.71Accuracy (%) (5-shot)98.8
Open Chinese LLM - CMMLU72.71Accuracy (%)97
Open Chinese LLM - HellaSwag70.34Accuracy (%)94.4
Open LLM Leaderboard v1 - HellaSwag88.46Normalized accuracy (%) (10-shot)92
Open Chinese LLM - GSM8K67.63Accuracy (%)91.5
Open Chinese LLM Leaderboard68.41Average Score (%)91.4
Open Chinese LLM - ARC Challenge60.92Accuracy (%)89.6
Open LLM Leaderboard v1 - ARC Challenge70.31Normalized accuracy (%) (25-shot)85.6
Open Chinese LLM - C-Eval Semantic87.05Accuracy (%)83.1
Open Chinese LLM - WinoGrande67.01Accuracy (%)80.9

Interactive version: theaggregate.ai/model?slug=tess-2-0-llama-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-23.