STAGE - Cross-Scene Reasoning (Hybrid RAG): leaderboard

Metric: Pass@5 (%; any of five generations judged correct, hybrid dense+lexical retrieval). Source: arxiv.org. Saturation forecast: Around 2028. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.665.1
2GPT-5.565
3Gemini 3.1 Pro (Preview)63.9
4Qwen 3 235B A22B63.7
5Qwen 3 30B A3B55.3
6Qwen 3 8B46.1

Interactive version: theaggregate.ai/benchmark?slug=stage-cross-scene-reasoning-hybrid-rag · How It Works · Data refreshed daily, snapshot 2026-09-25.