testmerge-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1503 ± 21, rank #1179 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag89.37Normalized accuracy (%) (10-shot)99.1
Open LLM Leaderboard v1 - ARC Challenge74.15Normalized accuracy (%) (25-shot)99
Open LLM Leaderboard v1 - WinoGrande85.32Accuracy (%) (5-shot)98.1
Open LLM Leaderboard v1 - TruthfulQA MC274.67MC2 (%) (0-shot)95.1
Open LLM Leaderboard - MuSR46.86Score90.8
Open LLM Leaderboard v1 - GSM8K64.59Accuracy (%) (5-shot)78.6
Open LLM Leaderboard v1 - MMLU64.07Accuracy (%) (5-shot)65.4
Open LLM Leaderboard - BBH51.9Score58.3
Open LLM Leaderboard - GPQA30.03Score56.5
Open LLM Leaderboard - IFEval39.8Score39.7
Open LLM Leaderboard - MMLU-Pro30.6Score38.6
Open LLM Leaderboard - MATH Level 56.87Score36.9

Interactive version: theaggregate.ai/model?slug=testmerge-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.