Multivac Evaluation: leaderboard

Open peer-review evaluation where LLMs rate each other's responses. Aggregates peer scores across multiple evaluation rounds to measure general quality.

Metric: Avg Peer Score (0-10). Source: github.com. 19 models tracked.

Top models

#ModelScore
1Mistral Small Creative9.6
2Grok 4.1 Fast9.18
3Grok Code Fast 19.12
4MiMo-V2-Flash8.96
5Claude Opus 4.58.95
6DeepSeek V38.93
7Claude Sonnet 4.58.92
8Gemini 3 Flash8.92
9Gemini 2.5 Flash8.72
10Gemini 2.5 Flash Lite8.72
11GPT-OSS-120B8.58
12GLM-4.77.28
13Gemini 3 Pro7.2
14MiniMax-M25.93

Interactive version: theaggregate.ai/benchmark?slug=multivac-evaluation · How It Works · Data refreshed daily, snapshot 2026-09-05.