R1 — benchmark results

Provider: Other. Access: Open.

Unified ELO 1696 ± 15, rank #337 of 1839 rated models, from 76 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Enhancing Agent Safety Judgment94.53Original (Seed) (self-reported)100
LexGenius64.59CoT average (self-reported)100
MedHELM66.25Mean Win Rate (self-reported)100
PhysicsFinals44.3Score (self-reported)96.9
MixRea9.5Implicit Information Ignorance Rate (I3R) (self-reported)95
Disentangling Language Roles in Multilingual L82.2JointSuccess (self-reported)94.7
TuRTLe Code Completion (Verilator)75.99Aggregated Score (self-reported)90.7
TuRTLe Spec-to-RTL (Icarus Verilog)75.53Aggregated Score (self-reported)90.7
TuRTLe Spec-to-RTL (Verilator)75.78Aggregated Score (self-reported)90.7
Defects4J47.5Defects4J Plausible @1 (self-reported)90.6
OJBench26.02Score (self-reported)88.9
OpenHuEval62.31Macro Average (computed) (self-reported)88.9

Interactive version: theaggregate.ai/model?slug=r1 · How It Works · Data refreshed daily, snapshot 2026-08-05.