PaperMind - Cross-Source Evidence Reasoning: leaderboard

Metric: Judge score for answering research questions that need evidence from the paper PDF, its cited references and external sources, as a smolagents ReAct agent with tools; rated by a GPT-4o judge on a 5-point scale (1-5) against the reference, averaged over the seven scientific domains; higher is better. Source: arxiv.org. Saturation forecast: Around January 2028. 7 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro2.99
2GPT-4o Mini2.71
3Claude 3 Haiku2.49
4Qwen 3 VL 4B Instruct2.45
5Claude 3.5 Sonnet2.3
6Gemma 3 4B (IT)1.81

Interactive version: theaggregate.ai/benchmark?slug=papermind-cross-source-evidence-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-07.