MedMeta - Retrieved Abstracts (Top 10): leaderboard

Metric: LLM-judge score (0-5; mean of Gemini 2.5 Pro, o4-mini and Qwen3-235B judges rating semantic equivalence of the generated conclusion to the meta-analysis's own, 81 meta-analyses; Standard-RAG: 10 abstracts per sub-question from a 25,000-abstract corpus, hybrid search and reranker). Source: arxiv.org. Saturation forecast: Estimated already saturated. 7 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash3.17
2O4 Mini2.94
3Qwen 3 8B (Non-reasoning)2.63
4Gemma 3 27B2.31
5Qwen 3 8B (Thinking)2.3
6DeepSeek R1 0528 Qwen3 8B2.13

Interactive version: theaggregate.ai/benchmark?slug=medmeta-retrieved-abstracts-top-10 · How It Works · Data refreshed daily, snapshot 2026-09-25.