final_model_test_v2: benchmark results

Provider: Other. Access: Open.

Unified ELO 1520 ± 21, rank #1042 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag90.86Normalized accuracy (%) (10-shot)99.8
Open LLM Leaderboard v1 - ARC Challenge77.73Normalized accuracy (%) (25-shot)99.7
Open LLM Leaderboard v1 - TruthfulQA MC279.16MC2 (%) (0-shot)99.6
Open LLM Leaderboard v1 - WinoGrande86.27Accuracy (%) (5-shot)99.1
Open LLM Leaderboard v1 - MMLU67.86Accuracy (%) (5-shot)90
Open LLM Leaderboard - BBH63.42Score87.4
Open LLM Leaderboard v1 - GSM8K66.94Accuracy (%) (5-shot)82.8
Open LLM Leaderboard - GPQA32.72Score79.2
Open LLM Leaderboard - MuSR43.14Score71.5
Open LLM Leaderboard - MMLU-Pro35.28Score52.4
Open LLM Leaderboard - MATH Level 58.38Score42.2
Open LLM Leaderboard - IFEval31.91Score29.5

Interactive version: theaggregate.ai/model?slug=final-model-test-v2 · How It Works · Data refreshed daily, snapshot 2026-09-23.