tulu-2-7B — benchmark results

Provider: Allen AI. Released 2023-11-13. Access: Open.

Unified ELO 1293 ± 17, rank #1545 of 1776 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Trustworthy - Stereotype96.6Trust Score (%)68
LLM Trustworthy - Out-of-Distribution69.3Trust Score (%)60
LLM Trustworthy - Adversarial44.62Trust Score (%)44
LLM Trustworthy - Adversarial Demo60.49Trust Score (%)44
LLM Trustworthy Leaderboard63.56Average Trust Score (%)44
Open CoT - LogiQA3.67CoT Gain (%)43.1
Finetuning with Scientific Data Increases Hall62.7OFS (self-reported)41.2
Open CoT - LSAT Analytical Reasoning3.04CoT Gain (%)41.2
LLM Trustworthy - Ethics49Trust Score (%)40
LLM Trustworthy - Fairness83.21Trust Score (%)36
Open CoT - LSAT Reading Comprehension8.55CoT Gain (%)35.5
Open CoT Leaderboard5.29Average CoT Gain (%)35.1

Interactive version: theaggregate.ai/model?slug=tulu-2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.