ReflectionCoder-DS-33B — benchmark results

Provider: Other. Released 2024-05-28. Access: Open.

Unified ELO 1292 ± 40, rank #1548 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BigCodeBench42.4Pass@1 (%)65.9
Open LLM Leaderboard - IFEval37.87Score37.1
Open LLM Leaderboard - GPQA3.24Score29.4
Open Chinese LLM - TruthfulQA MC49.97Accuracy (%)19
Open LLM Leaderboard - MATH Level 53.02Score19
Open LLM Leaderboard - BBH8.34Score17.9
Open Chinese LLM - GSM8K22.14Accuracy (%)14.7
Open Chinese LLM - ARC Challenge43.6Accuracy (%)12.2
Open Chinese LLM - HellaSwag52.43Accuracy (%)11.3
Open Chinese LLM - WinoGrande58.88Accuracy (%)10.2
Open Chinese LLM - C-Eval Semantic50.82Accuracy (%)9.8
Open LLM Leaderboard - MMLU-Pro2.24Score9.6

Interactive version: theaggregate.ai/model?slug=reflectioncoder-ds-33b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.