multi_verse_model — benchmark results

MTSAIR's Mistral-7B-based conversational fine-tune, trained with the company's in-house 'new approach' training method. Provider: Other. Released 2024-03-07. Access: Open.

Unified ELO 1403 ± 17, rank #1211 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC63.84Accuracy (%)95.4
Open Korean LLM Leaderboard282.41Average Score (%)65.7
Open Chinese LLM - HellaSwag60.67Accuracy (%)56.2
Open Chinese LLM - GSM8K47.23Accuracy (%)56.1
Open Chinese LLM - ARC Challenge53.24Accuracy (%)54.6
Open Chinese LLM - WinoGrande63.22Accuracy (%)54.5
Open Chinese LLM Leaderboard56.75Average Score (%)53.6
Open Chinese LLM - C-Eval Semantic62.51Accuracy (%)30.3
Open Chinese LLM - CMMLU46.53Accuracy (%)17.5

Interactive version: theaggregate.ai/model?slug=multi-verse-model · How the rankings work · Data refreshed daily, snapshot 2026-07-22.