MedMeta - Retrieved Abstracts (Top 5): leaderboard

Metric: LLM-judge score (0-5; mean of Gemini 2.5 Pro, o4-mini and Qwen3-235B judges rating semantic equivalence of the generated conclusion to the meta-analysis's own, 81 meta-analyses; Standard-RAG: 5 abstracts per sub-question from a 25,000-abstract corpus, hybrid search and reranker). Source: arxiv.org. Saturation forecast: Estimated already saturated. 7 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash3.03
2O4 Mini2.9
3Qwen 3 8B (Non-reasoning)2.53
4Qwen 3 8B (Thinking)2.46
5Gemma 3 27B2.37
6DeepSeek R1 0528 Qwen3 8B2.1

Interactive version: theaggregate.ai/benchmark?slug=medmeta-retrieved-abstracts-top-5 · How It Works · Data refreshed daily, snapshot 2026-09-25.