NovGauge - Pairwise Novelty - Problem F1: leaderboard

Metric: F1 (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite89.2
2Gemini 3.1 Pro (Preview)77.1
3Qwen 3.5 27B76.7
4Kimi K2.676.5
5Qwen 3.6 Plus74.9
6MiniMax-M2.773.3
7GPT-5.569.4
8GLM-5.169.3
9Gemma 4 31B (IT)66.2
10Claude Opus 4.766.2
11Claude Sonnet 4.666.1
12DeepSeek V4 Pro60.3
13DeepSeek V4 Flash60
14GPT-5.4 Mini56.7
15Qwen 3 32B56.6

Interactive version: theaggregate.ai/benchmark?slug=novgauge-pairwise-novelty-problem-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.