GPT-4 (0314) — benchmark results

March 14, 2023 GPT-4 API snapshot, kept separate from later GPT-4 snapshots. Provider: OpenAI. Released 2023-03-14. Access: API.

Unified ELO 1468 ± 35, rank #914 of 1776 rated models, from 42 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ConvRe - Re2Text Easy98.7Accuracy (%)100
JustEval - Helpfulness4.9Score (1-5)100
LLM Trustworthy - Out-of-Distribution87.55Trust Score (%)100
HellaSwag95.3Accuracy (%)98
SpeechMap Compliance95.2% Requests Completed97
JustEval - Clarity4.99Score (1-5)96.7
JustEval - Factuality4.9Score (1-5)96.7
MMLU86.4Accuracy (%)95.6
WinoGrande87.5Accuracy (%)95.6
GSM8K92Accuracy (%)94.7
LLM Trustworthy - Adversarial64.04Trust Score (%)92
AlpacaEval 1.094.78Win Rate (%)91.6

Interactive version: theaggregate.ai/model?slug=gpt-4-0314 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.