GPT-4o Search Preview: benchmark results

Provider: OpenAI. Released 2025-03-11. Access: API.

Unified ELO 1690 ± 27, rank #350 of 2656 rated models, from 22 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Tinybird AI SQL Benchmark - Exactness57.21Result exactness vs human reference queries (0-100)94.8
DeepResearch Bench - Citation Accuracy86.63Score (%)91.7
LLMEval-Fair - Medicine8.27Discipline Score (0-10)78.4
LLMEval-Fair - Literature7.77Discipline Score (0-10)73.3
Tinybird AI SQL Benchmark - Success Rate100Questions answered with a valid query within 3 retries (%)72.5
LLMEval-Fair - Education8.43Discipline Score (0-10)67.2
LLMEval-Fair - Engineering8.27Discipline Score (0-10)67.2
LLMEval-Fair - History8.73Discipline Score (0-10)67.2
LLMEval-Fair - Law8.67Discipline Score (0-10)67.2
LLMEval-Fair - Overall83.73Absolute Score (0-100)67.2
LLMEval-Fair - Economics8.77Discipline Score (0-10)65.5
LLMEval-Fair - Management8.8Discipline Score (0-10)63.8

Interactive version: theaggregate.ai/model?slug=gpt-4o-search-preview · How It Works · Data refreshed daily, snapshot 2026-09-19.