tulu-2-13B — benchmark results

Provider: Allen AI. Released 2023-11-13. Access: Open.

Unified ELO 1283 ± 15, rank #1572 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Trustworthy - Fairness97.9Trust Score (%)76
LLM Trustworthy - Adversarial Demo71.17Trust Score (%)72
LLM Trustworthy - Out-of-Distribution70.17Trust Score (%)64
LLM Trustworthy - Stereotype89.33Trust Score (%)56
LLM Trustworthy Leaderboard66.51Average Trust Score (%)52
LLM Trustworthy - Toxicity44.8Trust Score (%)48
LLM Trustworthy - Privacy78.9Trust Score (%)44
Open CoT - LogiQA 25.47CoT Gain (%)42
BiGGen-Bench3.21Average Score (1-5)41.2
Open CoT - LSAT Logical Reasoning8.63CoT Gain (%)39.7
Open CoT - LSAT Reading Comprehension7.81CoT Gain (%)32.8
Open CoT Leaderboard5.03Average CoT Gain (%)32.4

Interactive version: theaggregate.ai/model?slug=tulu-2-13b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.