OpenLearnLM - Skills - Assessment: leaderboard

Metric: Rubric Score (1-10; LLM judge, scenario-specific rubrics, Assessment center). Source: arxiv.org. Saturation forecast: Around April 2027. 7 models tracked.

Top models

#ModelScore
1Claude Opus 4.58.56
2DeepSeek V3.28.52
3Grok 4.1 Fast8.49
4Kimi K2 (Thinking)8.46
5Gemini 3 Pro8.38
6GLM-4.78.28
7GPT-5.28.22

Interactive version: theaggregate.ai/benchmark?slug=openlearnlm-skills-assessment · How It Works · Data refreshed daily, snapshot 2026-09-25.