CatPPT-base: benchmark results

Provider: Other. Access: Open.

Unified ELO 1497 ± 21, rank #1269 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K70.66Accuracy (%) (5-shot)93.8
Open LLM Leaderboard v1 - MMLU65.26Accuracy (%) (5-shot)83.5
Open LLM Leaderboard v1 - HellaSwag86.64Normalized accuracy (%) (10-shot)82.1
Open LLM Leaderboard v1 - ARC Challenge67.92Normalized accuracy (%) (25-shot)78.6
Open LLM Leaderboard v1 - WinoGrande81.29Accuracy (%) (5-shot)78.3
Open Portuguese LLM - ASSIN2 RTE92.36Macro F1 (%)78.2
Open LLM Leaderboard v1 - TruthfulQA MC261.72MC2 (%) (0-shot)78.1
Open Portuguese LLM - FaQuAD NLI76.94Macro F1 (%)78.1
Open Portuguese LLM - BLUEX55.91Accuracy (%)64.6
Open Portuguese LLM - ENEM65.36Accuracy (%)61.4
Open Portuguese LLM - OAB Exams42.96Accuracy (%)53.9

Interactive version: theaggregate.ai/model?slug=catppt-base · How It Works · Data refreshed daily, snapshot 2026-09-23.