GPT-NeoXT-Chat-Base-20B — benchmark results

Provider: Together. Released 2023-03-03. Access: Open.

Unified ELO 1168 ± 12, rank #1721 of 1776 rated models, from 78 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - College Chemistry39Accuracy (%)70.2
MMLU-by-task - College Mathematics34Accuracy (%)69.2
MMLU-by-task - Abstract Algebra32Accuracy (%)68.1
MMLU-by-task - High School Physics32.45Accuracy (%)65.9
MMLU-by-task - Global Facts35Accuracy (%)64.1
ToolBench - WebShop Short0.7Task Score53.5
ToolBench - WebShop Long0Task Score44.2
MMLU-by-task - College Physics23.53Accuracy (%)41.5
MMLU-by-task - Electrical Engineering37.93Accuracy (%)41.5
MMLU-by-task - HellaSwag55.1Accuracy (%)40
ToolBench - The Cat API73Task Score39.5
MMLU-by-task - Human Sexuality39.69Accuracy (%)39.4

Interactive version: theaggregate.ai/model?slug=gpt-neoxt-chat-base-20b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.