Llama 3.3 Nemotron Super 49B (v1): benchmark results

Provider: NVIDIA. Released 2025-03-18. Access: Open.

Unified ELO 1555 ± 31, rank #595 of 1636 rated models, from 83 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RFEval - Context Understanding81.7Contrast-conditional reasoning faithfulness (%): after a cou100
RFEval - Paper Review98.47Contrast-conditional reasoning faithfulness (%): after a cou100
RFEval - Mathematical Reasoning44.9Contrast-conditional reasoning faithfulness (%): after a cou90.9
RFEval68.52Contrast-conditional reasoning faithfulness (%): after a cou90
RFEval - Logical Reasoning77.13Contrast-conditional reasoning faithfulness (%): after a cou81.8
RFEval - Table Reasoning69.38Contrast-conditional reasoning faithfulness (%): after a cou72.7
AA MATH-50095.87Accuracy (%)70
RFEval - Code Generation26.48Contrast-conditional reasoning faithfulness (%): after a cou68.2
AA Omniscience - Software Engineering (SWE) - HTML34Accuracy (%)65.9
RFEval - Legal Decision80.38Contrast-conditional reasoning faithfulness (%): after a cou63.6
ZeroEval MATH-50096.6MATH-500 Score62.5
AA MMLU-Pro78.46Accuracy (%)60.6

Interactive version: theaggregate.ai/model?slug=llama-3-3-nemotron-super-49b-v1 · How It Works · Data refreshed daily, snapshot 2026-10-11.