tau-1.8B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1351 ± 22, rank #2475 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K30.17Accuracy (%) (5-shot)47.3
Open Portuguese LLM - FaQuAD NLI59.81Macro F1 (%)43.8
Open LLM Leaderboard v1 - MMLU45.96Accuracy (%) (5-shot)24.5
Open Portuguese LLM - ENEM26.1Accuracy (%)21.7
Open Portuguese LLM - ASSIN2 RTE62.41Macro F1 (%)21.6
Open Portuguese LLM - BLUEX23.5Accuracy (%)16.9
Open Portuguese LLM - OAB Exams25.47Accuracy (%)16.7
Open LLM Leaderboard v1 - ARC Challenge37.2Normalized accuracy (%) (25-shot)14.6
Open LLM Leaderboard v1 - HellaSwag60.26Normalized accuracy (%) (10-shot)14.4
Open LLM Leaderboard v1 - WinoGrande61.09Accuracy (%) (5-shot)14.3
Open LLM Leaderboard v1 - TruthfulQA MC239.72MC2 (%) (0-shot)11.8

Interactive version: theaggregate.ai/model?slug=tau-1-8b · How It Works · Data refreshed daily, snapshot 2026-09-23.