NovGauge - Multi-Paper Grouping - Task F1: leaderboard

Metric: F1 (%). Source: arxiv.org. 12 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.678.8
2GPT-5.577.1
3Claude Opus 4.777.1
4Gemini 3.1 Pro (Preview)75.5
5Qwen 3.6 Plus75.5
6Gemini 3.1 Flash Lite75.4
7Kimi K2.668.6
8GLM-5.165.8
9MiniMax-M2.762
10GPT-5.4 Mini60.4
11DeepSeek V4 Pro57.9
12DeepSeek V4 Flash53.7

Interactive version: theaggregate.ai/benchmark?slug=novgauge-multi-paper-grouping-task-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.