GPT-3.5 Turbo: benchmark results

OpenAI GPT-3.5 Turbo chat model, tracked as a legacy chat/API baseline. Provider: OpenAI. Released 2022-11-30. Access: API.

Unified ELO 1454 ± 1, rank #923 of 1392 rated models, from 420 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RABBITS MedMCQA G2B97.7Accuracy (%)100
RABBITS MedMCQA Original98.28Accuracy (%)100
YapBench22.7YapIndex (lower is better)99
RABBITS MedQA G2B96.03Accuracy (%)98
RABBITS MedQA Original96.3Accuracy (%)96
HumanLikeness - Word-168.9Humanlike Score (%)94.7
URIAL-Bench - Coding6.9Judge Score (0-10)94.4
URIAL-Bench - Extraction8.85Judge Score (0-10)94.4
URIAL-Bench - Math6.3Judge Score (0-10)94.4
URIAL-Bench - Overall7.94Judge Score (0-10)94.4
URIAL-Bench - Roleplay8.4Judge Score (0-10)94.4
URIAL-Bench - Turn 18.07Judge Score (0-10)94.4

Interactive version: theaggregate.ai/model?slug=gpt-3-5-turbo · How It Works · Data refreshed daily, snapshot 2026-09-05.