RubberDuckBench — leaderboard

Metric: Performance (%). Source: cs.brynmawr.edu. 20 models tracked.

Top models

#ModelScore
1Grok 469.29
2Claude Opus 468.53
3GPT-567.8
4Claude Opus 4.167.02
5O364.93
6Gemini 2.5 Flash64.3
7Gemini 2.5 Pro64.01
8GPT-OSS-20B63.63
9Claude Sonnet 461.66
10Claude 3.7 Sonnet61.47
11GPT-OSS-120B59.54
12GPT-4.159.47
13Llama 3.3 70B56.36
14Grok 354.74
15DeepSeek R154.4

Interactive version: theaggregate.ai/benchmark?slug=rubberduckbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.