ReflectionCoder-DS-33B: benchmark results

Provider: Other. Released 2024-05-28. Access: Open.

Unified ELO 1347 ± 1, rank #1276 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BigCodeBench42.4Pass@1 (%)65.9
Open LLM Leaderboard - IFEval37.87Score37
Open LLM Leaderboard - GPQA3.24Score29.4
Open Chinese LLM - TruthfulQA MC49.97Accuracy (%)19
Open LLM Leaderboard - MATH Level 53.02Score19
Open LLM Leaderboard - BBH8.34Score17.9
Open Chinese LLM - GSM8K22.14Accuracy (%)14.7
Open Chinese LLM - ARC Challenge43.6Accuracy (%)12.2
Open Chinese LLM - HellaSwag52.43Accuracy (%)11.3
Open Chinese LLM - WinoGrande58.88Accuracy (%)10.2
Open Chinese LLM - C-Eval Semantic50.82Accuracy (%)9.8
Open LLM Leaderboard - MMLU-Pro2.24Score9.6

Interactive version: theaggregate.ai/model?slug=reflectioncoder-ds-33b · How It Works · Data refreshed daily, snapshot 2026-09-05.