PokeAgent Challenge — leaderboard

Pokemon battling benchmark evaluating AI strategic reasoning, opponent modeling, and decision-making under partial observability in competitive Gen 9 OU battles with extended timers for LLM agents.

Metric: Elo Rating. Source: pokeagentchallenge.com. Status: saturation imminent. 33 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)1924
2GPT-51906
3GLM-51773.4
4Claude Opus 4.61670.2
5Grok 3 Mini1598.5
6Claude Sonnet 4.61561.8
7Grok 31553.4
8MiniMax-M2.51543
9Hermes 4 405B1499.6
10DeepSeek V31476.8
11Kimi K2.51472.5
12Qwen 3.5 Plus1458.3
13Gemini 3 Flash1390.6
14Gemini 3 Pro1359.4
15Gemini 2.5 Flash1232.3

Interactive version: theaggregate.ai/benchmark?slug=pokeagent-challenge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.