Sonar Deep Research: benchmark results
Provider: Perplexity. Access: API.
Unified ELO 1790 ± 32, rank #100 of 1605 rated models, from 16 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LitReviewBench - Research Suggestions | 1322.7 | Expert-preference rating (Elo scale, Bradley-Terry aggregati | 100 |
| LitReviewBench | 1285.9 | Expert-preference rating (Elo scale, Bradley-Terry aggregati | 87.5 |
| LitReviewBench - Claim Support | 1106.3 | Expert-preference rating (Elo scale, Bradley-Terry aggregati | 87.5 |
| LitReviewBench - Literature Coverage | 1175.9 | Expert-preference rating (Elo scale, Bradley-Terry aggregati | 87.5 |
| LitReviewBench - Paper Structure | 1262.1 | Expert-preference rating (Elo scale, Bradley-Terry aggregati | 87.5 |
| Tinybird AI SQL Benchmark - Success Rate | 100 | Questions answered with a valid query within 3 retries (%) | 72.3 |
| Tinybird AI SQL Benchmark - Exactness | 49.82 | Result exactness vs human reference queries (0-100) | 57.7 |
| Mr Dre - Content Feedback Incorporation Rate | 92.6 | Incorporation rate (%; turn-2 revision after content feedbac | 50 |
| OneMillion-Bench | 13.5 | Pass Rate (%) | 45.6 |
| Software Engineering Arena - Model Arena | 998 | Elo Rating | 38.6 |
| LM Market Cap LMC Score | 40 | LMC Score (0-100) | 28.3 |
| Mr Dre - Content Feedback Break Rate | 34.3 | Break rate (%; share of checklist criteria covered in the tu | 25 |
Interactive version: theaggregate.ai/model?slug=sonar-deep-research · How It Works · Data refreshed daily, snapshot 2026-09-26.