LogicKor — leaderboard
Korean multi-domain reasoning benchmark leaderboard covering reasoning, math, writing, coding, comprehension, grammar, single-turn, and multi-turn tasks.
Metric: Score (0-10). Source: lk.instruct.kr. Status: saturated. 253 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4o (2024-05-13) | 9.41 |
| 2 | Claude 3.5 Sonnet (20240620) | 9.3 |
| 3 | Gemini 1.5 Pro (001) | 9.29 |
| 4 | GPT-4 Preview (0125) | 9.29 |
| 5 | GPT-4 Preview (1106) | 9.17 |
| 6 | GPT-4 Turbo | 9.09 |
| 7 | Mistral Large 2 (Jul) | 9.03 |
| 8 | Gemini 1.5 Flash (001) | 8.98 |
| 9 | Claude 3 Opus (20240229) | 8.96 |
| 10 | Llama-VARCO-8B-Instruct | 8.83 |
| 11 | Llama 3.1 405B Instruct FP8 | 8.79 |
| 12 | GPT-4 (0613) | 8.67 |
| 13 | ko-gemma-2-9B-it | 8.67 |
| 14 | Qwen 2 72B Instruct | 8.61 |
| 15 | Claude 3 Sonnet (20240229) | 8.38 |
Interactive version: theaggregate.ai/benchmark?slug=logickor · How the rankings work · Data refreshed daily, snapshot 2026-07-22.