samantha-1.1-llama-33B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1414 ± 10, rank #2017 of 2928 rated models, from 78 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - TruthfulQA MC144.43Accuracy (%)98.6
MMLU-by-task - TruthfulQA MC261.19Accuracy (%)97.7
MMLU-by-task - ARC Challenge65.02Accuracy (%)95.7
MMLU-by-task - Abstract Algebra37Accuracy (%)94.5
MMLU-by-task - HellaSwag67.64Accuracy (%)94.4
MMLU-by-task - Virology52.41Accuracy (%)92.8
MMLU-by-task - Sociology82.09Accuracy (%)90.8
MMLU-by-task - High School World History82.7Accuracy (%)90.7
MMLU-by-task - High School Computer Science64Accuracy (%)89.6
MMLU-by-task - Machine Learning45.54Accuracy (%)89.4
MMLU-by-task - Conceptual Physics51.49Accuracy (%)89
MMLU-by-task - Professional Medicine59.19Accuracy (%)89

Interactive version: theaggregate.ai/model?slug=samantha-1-1-llama-33b · How It Works · Data refreshed daily, snapshot 2026-09-23.