gpt2-chatbot: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1219 ± 20, rank #2870 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BenchTable77.1Total Score (%)94.8
BenchTable - Reasoning75.6Weighted Score (%)90.6
BenchTable - STEM73.3Weighted Score (%)82.6
BenchTable - Tech77.4Weighted Score (%)82.6
BenchTable - Utility66.9Weighted Score (%)76
Open LLM Leaderboard v1 - TruthfulQA MC240.38MC2 (%) (0-shot)13.9
Open LLM Leaderboard v1 - MMLU26.42Accuracy (%) (5-shot)12.5
Open LLM Leaderboard v1 - HellaSwag50.27Normalized accuracy (%) (10-shot)10.4
Open LLM Leaderboard v1 - WinoGrande56.67Accuracy (%) (5-shot)10
Open LLM Leaderboard v1 - ARC Challenge29.69Normalized accuracy (%) (25-shot)9
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6

Interactive version: theaggregate.ai/model?slug=gpt2-chatbot · How It Works · Data refreshed daily, snapshot 2026-09-23.