LongDS v1.1 Lite: leaderboard

Metric: Accuracy (%; judged turn accuracy macro-averaged over 24 tasks), each model under one agentic coding harness. Source: zjunlp.github.io. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1GPT-678.17
2Claude Fable 5.176.53
3GPT-5.6 Sol70.71
4Kimi K368.9
5Qwen 3.8 Max (0902)62.58
6GLM-5.256.59
7DeepSeek V4 Pro39.33

Interactive version: theaggregate.ai/benchmark?slug=longds-v1-1-lite · How It Works · Data refreshed daily, snapshot 2026-09-25.