Linguini - IOL-AI Harness: leaderboard

Metric: Geometric Mean of chrF and Exact Match (%; after custom answer parsing). Source: arxiv.org. Saturation forecast: Around April 2027. 18 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol51.5
2Gemini 3.6 Flash50.8
3Claude Opus 4.843.7
4Qwen 3.7 Max35.6
5DeepSeek V4 Pro32.9
6GLM-5.230.7
7Kimi K2.628.8
8Inkling28.6
9Qwen 3.8 27B25.2
10Muse Glimmer 30B (High)22.9
11Nemotron 3 Ultra19.4
12Gemma 4 31B17.8
13Qwen 3.6 27B (Thinking)15.9
14Qwen 3.6 27B (Non-reasoning)15.8
15MiniMax-M311.2

Interactive version: theaggregate.ai/benchmark?slug=linguini-iol-ai-harness · How It Works · Data refreshed daily, snapshot 2026-09-24.