Chat2Workflow - Research: leaderboard

Metric: Resolve rate (%) on Chat2Workflow research tasks: share of test cases where the workflow the model generates for the current round of a multi-turn request, deployed on Dify 1.9.2, executes and its output satisfies every requirement of the instruction, judged by GPT-5.1; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)62.96
2GLM-4.657.04
3Claude Sonnet 4.556.3
4GLM-4.754.82
5GPT-5.253.33
6Kimi K2 (Thinking)44.44
7DeepSeek V3.142.22
8GPT-5.141.48
9DeepSeek V3.240.74
10Kimi K240.74
11Qwen 3 235B A22B32.59
12Qwen 3 Coder 480B A35B Instruct29.63
13Qwen 3 32B22.22
14Qwen 3 8B21.48
15Qwen 3 14B18.52

Interactive version: theaggregate.ai/benchmark?slug=chat2workflow-research · How It Works · Data refreshed daily, snapshot 2026-10-07.