LibEvoBench - Evolving APIs: leaderboard

Metric: Average task performance (0-100) on evolving APIs (signature changed, introduced or deprecated within the covered versions): mean of four task metrics (API calling with version constraint, exact match; API calling parameter recall given name and version; API identification from a redacted docstring, exact match; signature recall F1) averaged over PyTorch, NumPy and SciPy versions, temperature 0 where supported and no thinking budget; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 13 models tracked.

Top models

#ModelScore
1GPT-5.486.4
2GPT-5.586.1
3Claude Sonnet 4.682.4
4Claude Sonnet 478.5
5Gemini 3 Flash (Minimal)78.5
6GPT-4.171.7
7GPT-5.171.6
8GPT-571.5
9Gemini 2.5 Flash (Non-reasoning)69.8
10Qwen 3.5 397B A17B (Non-reasoning)68.9
11Gemini 2.0 Flash67.5
12Qwen 3.5 122B A10B (Non-reasoning)62.3
13Qwen 3.5 35B A3B (Non-reasoning)54.7

Interactive version: theaggregate.ai/benchmark?slug=libevobench-evolving-apis · How It Works · Data refreshed daily, snapshot 2026-09-29.