Neural-SOVLish-Devil-8B-L3: benchmark results

Provider: Other. Access: Open.

Unified ELO 1506 ± 19, rank #1153 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K73.09Accuracy (%) (5-shot)98.5
Open LLM Leaderboard v1 - MMLU69.02Accuracy (%) (5-shot)92.1
Open LLM Leaderboard v1 - ARC Challenge69.11Normalized accuracy (%) (25-shot)82.3
Open LLM Leaderboard v1 - TruthfulQA MC259.05MC2 (%) (0-shot)73.2
Open LLM Leaderboard v1 - HellaSwag84.77Normalized accuracy (%) (10-shot)68.4
Open LLM Leaderboard - MMLU-Pro38.07Score65.7
Open LLM Leaderboard - GPQA30.79Score65.2
Open LLM Leaderboard v1 - WinoGrande78.3Accuracy (%) (5-shot)62
Open LLM Leaderboard - BBH51.42Score56.1
Open LLM Leaderboard - MuSR41.1Score51.1
Open LLM Leaderboard - MATH Level 58.91Score43.9
Open LLM Leaderboard - IFEval41.99Score42.9

Interactive version: theaggregate.ai/model?slug=neural-sovlish-devil-8b-l3 · How It Works · Data refreshed daily, snapshot 2026-09-23.