TerraLogic - Argument Accuracy: leaderboard

Metric: Tool-argument accuracy (ArgAcc) (%) in the step-by-step setting over the 545 TerraLogic optical, SAR and infrared remote-sensing tasks, each model driving the HieraPlan tool agent under a ReAct-style protocol in OpenCompass; higher is better. Source: arxiv.org. Saturation forecast: Around 2037. 12 models tracked.

Top models

#ModelScore
1GPT-4o23.57
2DeepSeek V323.32
3Qwen 2.5 7B Instruct23.11
4Llama 3 70B Instruct22.66
5InternLM3-8B-Instruct22.59
6GPT-3.521.88
7Qwen 2.5 32B Instruct17.41
8Phi-3 Mini 4K Instruct17.17
9Mistral 7B Instruct (v0.2)16.73
10Yi-1.5-6B-Chat16
11Gemini 2.5 Flash15.75

Interactive version: theaggregate.ai/benchmark?slug=terralogic-argument-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-29.