Smolagents - Overall (Code Agent): leaderboard

Metric: Accuracy (%). Source: huggingface.co. Saturation forecast: Estimated already saturated. 15 models tracked.

Top models

#ModelScore
1GPT-4.5 (Preview)78.75
2Claude 3.7 Sonnet (20250219)77.33
3O176.67
4O3 Mini74.96
5Claude 3.5 Sonnet74.75
6DeepSeek R172.67
7QwQ-32B68.5
8GPT-4o64.13
9Qwen 2.5 72B Instruct64.04
10Llama 3.3 70B Instruct60.42
11Qwen 2.5 Coder 32B Instruct59.96
12DeepSeek R1 Distill Qwen 32B54.42
13Llama 3.1 70B Instruct49.88
14Llama 3.2 3B Instruct21.04
15Llama 3.1 8B Instruct5.33

Interactive version: theaggregate.ai/benchmark?slug=smolagents-overall-code-agent · How It Works · Data refreshed daily, snapshot 2026-10-09.