GPT-3.5 Turbo — benchmark results

OpenAI GPT-3.5 Turbo chat model, tracked as a legacy chat/API baseline. Provider: OpenAI. Released 2022-11-30. Access: API.

Unified ELO 1460 ± 9, rank #955 of 1776 rated models, from 422 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RABBITS MedMCQA G2B97.7Accuracy (%)100
RABBITS MedMCQA Original98.28Accuracy (%)100
RABBITS MedQA G2B96.03Accuracy (%)98
RABBITS MedQA Original96.3Accuracy (%)96
HumanLikeness - Word-168.9Humanlike Score (%)94.7
URIAL-Bench - Coding6.9Judge Score (0-10)94.4
URIAL-Bench - Extraction8.85Judge Score (0-10)94.4
URIAL-Bench - Math6.3Judge Score (0-10)94.4
URIAL-Bench - Overall7.94Judge Score (0-10)94.4
URIAL-Bench - Roleplay8.4Judge Score (0-10)94.4
URIAL-Bench - Turn 18.07Judge Score (0-10)94.4
URIAL-Bench - Turn 27.81Judge Score (0-10)94.4

Interactive version: theaggregate.ai/model?slug=gpt-3-5-turbo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.