Multivac Evaluation — leaderboard

Open peer-review evaluation where LLMs rate each other's responses. Aggregates peer scores across multiple evaluation rounds to measure general quality.

Metric: Avg Peer Score (0-10). Source: github.com. 19 models tracked.

Top models

#ModelScore
1Grok 4.1 Fast9.18
2Grok Code Fast 19.12
3MiMo-V2-Flash8.96
4Claude Opus 4.58.95
5DeepSeek V38.93
6Claude Sonnet 4.58.92
7Gemini 3 Flash8.92
8Gemini 2.5 Flash8.72
9Gemini 2.5 Flash Lite8.72
10GPT-OSS-120B8.58
11GLM-4.77.28
12Gemini 3 Pro7.2
13MiniMax-M25.93

Interactive version: theaggregate.ai/benchmark?slug=multivac-evaluation · How the rankings work · Data refreshed daily, snapshot 2026-07-22.