RuleWeaver - Cross-Source - Rubric Score: leaderboard

Metric: Judge rubric score (0-100). Source: arxiv.org. 11 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Non-reasoning)50.27
2GPT-5.5 (Non-reasoning)46.4
3GPT-5.4 (Non-reasoning)42.58
4Claude Sonnet 4.6 (Non-reasoning)36.56
5GLM-5 (Non-reasoning)32.35
6Kimi K2.6 (Non-reasoning)28.48
7DeepSeek V4 Pro (Non-reasoning)28.38
8Gemini 3.1 Pro (Preview) (Low)27.81
9MiniMax-M2.721.15

Interactive version: theaggregate.ai/benchmark?slug=ruleweaver-cross-source-rubric-score · How It Works · Data refreshed daily, snapshot 2026-09-19.