free-evo-qwen72B-v0.8-re — benchmark results

Freewheelin's evolutionary merge of Qwen2-based 72B models, inspired by Sakana AI's evolutionary model-merging method. Provider: Other. Released 2024-05-02. Access: Open.

Unified ELO 1575 ± 9, rank #546 of 1776 rated models, from 137 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - ARC Challenge71.16Accuracy (%)99.9
Open Chinese LLM - HellaSwag78.09Accuracy (%)99.4
Open Chinese LLM Leaderboard74.62Average Score (%)99.4
Open Arabic LLM - Arabic MMLU HT Global Facts54Accuracy (%)98.8
Open Arabic LLM - Madinah QA Arabic Language (Grammar)70.96Accuracy (%)98.8
Open Chinese LLM - CMMLU73.88Accuracy (%)98.8
Open Chinese LLM - C-Eval Semantic91.21Accuracy (%)98.5
Open Chinese LLM - TruthfulQA MC66.27Accuracy (%)97.6
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task57.83Accuracy (%)97.5
Open Arabic LLM - Arabic MMLU Accounting (University)74.32Accuracy (%)97.2
Open Chinese LLM - GSM8K70.28Accuracy (%)96.4
Open Chinese LLM - WinoGrande71.43Accuracy (%)96.4

Interactive version: theaggregate.ai/model?slug=free-evo-qwen72b-v0-8-re · How the rankings work · Data refreshed daily, snapshot 2026-07-22.