Beyonder-4x7B-v3 — benchmark results

mlabonne's 4x7B LazyMergekit MoE routing AlphaMonarch chat, CodeNinja code, Kunoichi roleplay and NeuralDaredevil math experts. Provider: Other. Released 2024-03-21. Access: Open.

Unified ELO 1405 ± 13, rank #1198 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.16Accuracy (%)87.2
Open Korean LLM Leaderboard359.23Average Score (%)72
Open LLM Leaderboard - IFEval56.08Score68
Open Chinese LLM - GSM8K48.45Accuracy (%)62
Open Chinese LLM - ARC Challenge53.67Accuracy (%)58.8
Open Chinese LLM - HellaSwag60.5Accuracy (%)53.1
Open Chinese LLM Leaderboard56.3Average Score (%)45.7
Open LLM Leaderboard - MuSR8.93Score43
Open LLM Leaderboard - GPQA4.7Score40.2
Open Chinese LLM - WinoGrande62.19Accuracy (%)37.8
Open LLM Leaderboard - BBH24.56Score37.6
Open LLM Leaderboard - MATH Level 55.36Score29.8

Interactive version: theaggregate.ai/model?slug=beyonder-4x7b-v3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.