Tess-2.0-Llama-3-70B-v0.2: benchmark results

Provider: Other. Access: Open.

Unified ELO 1568 ± 17, rank #802 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU79.51Accuracy (%) (5-shot)99.5
Open LLM Leaderboard v1 - WinoGrande85.64Accuracy (%) (5-shot)98.7
Open LLM Leaderboard v1 - GSM8K73.09Accuracy (%) (5-shot)98.5
Open Chinese LLM - CMMLU73.61Accuracy (%)97.9
Open Chinese LLM - HellaSwag69.72Accuracy (%)93.2
Open Chinese LLM - GSM8K67.48Accuracy (%)91.1
Open LLM Leaderboard v1 - HellaSwag88.26Normalized accuracy (%) (10-shot)90.5
Open Chinese LLM Leaderboard67.69Average Score (%)88.7
Open LLM Leaderboard v1 - ARC Challenge69.54Normalized accuracy (%) (25-shot)83.5
Open Chinese LLM - ARC Challenge59.04Accuracy (%)82.5
Open Chinese LLM - WinoGrande66.69Accuracy (%)80
Open Chinese LLM - C-Eval Semantic86.37Accuracy (%)79.5

Interactive version: theaggregate.ai/model?slug=tess-2-0-llama-3-70b-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-23.