multi_verse_model: benchmark results
MTSAIR's Mistral-7B-based conversational fine-tune, trained with the company's in-house 'new approach' training method. Provider: Other. Released 2024-03-07. Access: Open.
Unified ELO 1487 ± 1, rank #749 of 1392 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 63.84 | Accuracy (%) | 95.4 |
| Open Korean LLM Leaderboard | 42.64 | Average Score (%) | 84.1 |
| Open Chinese LLM - HellaSwag | 60.67 | Accuracy (%) | 56.2 |
| Open Chinese LLM - GSM8K | 47.23 | Accuracy (%) | 56.1 |
| Open Chinese LLM - ARC Challenge | 53.24 | Accuracy (%) | 54.6 |
| Open Chinese LLM - WinoGrande | 63.22 | Accuracy (%) | 54.5 |
| Open Chinese LLM Leaderboard | 56.75 | Average Score (%) | 53.6 |
| Open Chinese LLM - C-Eval Semantic | 62.51 | Accuracy (%) | 30.3 |
| Open Chinese LLM - CMMLU | 46.53 | Accuracy (%) | 17.5 |
Interactive version: theaggregate.ai/model?slug=multi-verse-model · How It Works · Data refreshed daily, snapshot 2026-09-05.