Phi-3-small-8k-instruct: benchmark results

Microsoft's 7B Phi-3-small instruct model (May 2024) with 8K context and blocksparse attention, trained on 4.8T tokens to beat GPT-3.5 Turbo. Provider: Microsoft. Released 2024-05-21. Access: Open.

Unified ELO 1467 ± 1, rank #858 of 1392 rated models, from 74 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenBookQA88Accuracy (%)96.4
Epoch AI - Adversarial Nli58.1Score95
ARC Challenge (AI2)90.7Accuracy (%)93.4
Big-Bench Hard79.1Average (%)89.6
ChineseSafe Benchmark72.73Accuracy (%)88.9
Open LLM Leaderboard - MuSR16.77Score86.8
Open LLM Leaderboard - BBH46.21Score86.1
CanAiCode100Junior-v2 Python Pass Rate (%)85.6
Enkrypt AI - Safety Risk19.88Risk Score85.3
Open CoT - LSAT Reading Comprehension19.7CoT Gain (%)84
Open LLM Leaderboard - MMLU-Pro38.96Score83.8
Open CoT - LSAT Logical Reasoning17.84CoT Gain (%)83.6

Interactive version: theaggregate.ai/model?slug=phi-3-small-8k-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.