airoboros-70B-3.3: benchmark results

Provider: Other. Access: Open.

Unified ELO 1525 ± 19, rank #1011 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU79.31Accuracy (%) (5-shot)99.4
Open LLM Leaderboard v1 - GSM8K73.84Accuracy (%) (5-shot)98.9
Open LLM Leaderboard v1 - WinoGrande84.37Accuracy (%) (5-shot)93.1
Open LLM Leaderboard v1 - ARC Challenge71.67Normalized accuracy (%) (25-shot)89.9
Open Chinese LLM - CMMLU68.04Accuracy (%)78.9
Open LLM Leaderboard v1 - TruthfulQA MC259.68MC2 (%) (0-shot)74.2
Open LLM Leaderboard v1 - HellaSwag85.27Normalized accuracy (%) (10-shot)73.2
Open Chinese LLM - C-Eval Semantic77.79Accuracy (%)66.2
Open Chinese LLM - HellaSwag61.36Accuracy (%)62.3
Open Chinese LLM Leaderboard56.7Average Score (%)51.8
Open Chinese LLM - TruthfulQA MC52.88Accuracy (%)43.3
Open Chinese LLM - GSM8K37.23Accuracy (%)34.1

Interactive version: theaggregate.ai/model?slug=airoboros-70b-3-3 · How It Works · Data refreshed daily, snapshot 2026-09-23.