CatPPT: benchmark results

Provider: Other. Access: Open.

Unified ELO 1497 ± 21, rank #1268 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K70.81Accuracy (%) (5-shot)94.4
Open LLM Leaderboard v1 - MMLU65.16Accuracy (%) (5-shot)82.4
Open LLM Leaderboard v1 - HellaSwag86.69Normalized accuracy (%) (10-shot)82.3
Open LLM Leaderboard v1 - WinoGrande81.61Accuracy (%) (5-shot)80.1
Open Portuguese LLM - ASSIN2 RTE92.48Macro F1 (%)79.5
Open LLM Leaderboard v1 - ARC Challenge68.09Normalized accuracy (%) (25-shot)79.3
Open Portuguese LLM - FaQuAD NLI77.01Macro F1 (%)78.4
Open LLM Leaderboard v1 - TruthfulQA MC261.55MC2 (%) (0-shot)77.9
Open Portuguese LLM - BLUEX56.33Accuracy (%)65.9
Open Portuguese LLM - ENEM65.43Accuracy (%)61.7
Open Portuguese LLM - OAB Exams42.82Accuracy (%)53.5

Interactive version: theaggregate.ai/model?slug=catppt · How It Works · Data refreshed daily, snapshot 2026-09-23.