Test1_SLIDE: benchmark results

Provider: Other. Access: Open.

Unified ELO 1468 ± 16, rank #1576 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K61.18Accuracy (%) (5-shot)73.7
Open LLM Leaderboard v1 - TruthfulQA MC255.48MC2 (%) (0-shot)65.2
Open LLM Leaderboard v1 - MMLU63.8Accuracy (%) (5-shot)63.3
Open Chinese LLM - C-Eval Semantic72.54Accuracy (%)59.6
Open Chinese LLM - GSM8K43.44Accuracy (%)44.2
Open Chinese LLM - CMMLU52.19Accuracy (%)42
Open LLM Leaderboard v1 - WinoGrande75.22Accuracy (%) (5-shot)41
Open Chinese LLM - HellaSwag58.51Accuracy (%)40.1
Open Chinese LLM - WinoGrande62.27Accuracy (%)39.9
Open Chinese LLM Leaderboard55.17Average Score (%)38.3
Open LLM Leaderboard v1 - ARC Challenge57.42Normalized accuracy (%) (25-shot)37.5
Open LLM Leaderboard v1 - HellaSwag78.73Normalized accuracy (%) (10-shot)35.5

Interactive version: theaggregate.ai/model?slug=test1-slide · How It Works · Data refreshed daily, snapshot 2026-09-23.