multi_verse_model — benchmark results
MTSAIR's Mistral-7B-based conversational fine-tune, trained with the company's in-house 'new approach' training method. Provider: Other. Released 2024-03-07. Access: Open.
Unified ELO 1403 ± 17, rank #1211 of 1776 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 63.84 | Accuracy (%) | 95.4 |
| Open Korean LLM Leaderboard | 282.41 | Average Score (%) | 65.7 |
| Open Chinese LLM - HellaSwag | 60.67 | Accuracy (%) | 56.2 |
| Open Chinese LLM - GSM8K | 47.23 | Accuracy (%) | 56.1 |
| Open Chinese LLM - ARC Challenge | 53.24 | Accuracy (%) | 54.6 |
| Open Chinese LLM - WinoGrande | 63.22 | Accuracy (%) | 54.5 |
| Open Chinese LLM Leaderboard | 56.75 | Average Score (%) | 53.6 |
| Open Chinese LLM - C-Eval Semantic | 62.51 | Accuracy (%) | 30.3 |
| Open Chinese LLM - CMMLU | 46.53 | Accuracy (%) | 17.5 |
Interactive version: theaggregate.ai/model?slug=multi-verse-model · How the rankings work · Data refreshed daily, snapshot 2026-07-22.