SIN-Bench - SIN-Find: leaderboard

Metric: Evidence Discovery Score (%; mean of evidence matching, relevance F1 and Kendall-tau logic). Source: arxiv.org. Saturation forecast: Around 2031. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)46
2Gemini 3 Pro (Preview)39.9
3GPT-537.8
4Grok 437.8
5Qwen 3 VL 30B A3B (Thinking)35.2
6Gemini 2.5 Pro34.6
7Qwen 3 VL 8B (Thinking)34.6

Interactive version: theaggregate.ai/benchmark?slug=sin-bench-sin-find · How It Works · Data refreshed daily, snapshot 2026-09-25.