Ebisu - JF-ICR: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Llama 4 Scout60.64
2Llama-3.3-Swallow-70B-Instruct-v0.459.57
3Llama 3.3 70B Instruct56.38
4GPT-555.32
5Claude Sonnet 4.552.13
6DeepSeek V3.151.06
7Kimi K245.74
8Qwen 3 235B A22B 2507 Instruct45.74
9Gemini 3 Flash39.36
10Qwen 2.5 32B Instruct38.3
11Ministral-3-14B-Instruct-251237.23
12Qwen 3 32B19.15
13Qwen 3 14B18.09
14Qwen 3 8B12.77
15Qwen-14B6.38

Interactive version: theaggregate.ai/benchmark?slug=ebisu-jf-icr · How It Works · Data refreshed daily, snapshot 2026-09-19.