SuperCLUE General (2025 Annual) - Agentic Task Planning: leaderboard

Metric: Score. Source: www.superclueai.com. 34 models tracked.

Top models

#ModelScore
1GPT-5.2 (High)81.39
2Doubao-Seed-2.0-Pro-26021577.78
3Claude Opus 4.677.52
4Claude Opus 4.5 (Thinking)74.87
5Gemini 3.1 Pro (Preview) (High)71.03
6Qwen 3 Max (Thinking)70.13
7Qwen 3.5 397B A17B (Thinking)68.92
8Kimi K2.5 (Thinking)68.06
9Gemini 3 Pro (Preview)65.02
10Qwen 3 Max (Preview) (Thinking)64.4
11GLM-562.12
12Kimi K2 (Thinking)59.01
13Qwen 3.5 122B A10B (Thinking)56.5
14Qwen 3.5 27B (Thinking)56.14
15GLM-4.756.03

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-2025-annual-agentic-task-planning · How It Works · Data refreshed daily, snapshot 2026-09-19.