LLMEval-Logic Formalization Fixed — leaderboard

Metric: Accuracy (%). Source: llmeval.com. 14 models tracked.

Top models

#ModelScore
1GPT-5.4 Pro (xHigh)60.2
2Kimi K2.5 (Thinking)59.4
3Gemini 3.1 Pro (Preview) (Thinking)58.1
4Claude Opus 4.6 (Thinking)56.9
5Gemini 3.1 Pro (Preview)54.5
6Qwen 3.5 Plus (Thinking)52.4
7Hy3-preview (Reasoning)51.2
8Claude Opus 4.6 (Non-reasoning)50
9Kimi K2.5 (Non-reasoning)38.6
10Hy3-preview (Non-reasoning)24.8

Interactive version: theaggregate.ai/benchmark?slug=llmeval-logic-formalization-fixed · How the rankings work · Data refreshed daily, snapshot 2026-07-22.