Translation en->Set1 COMET22 — leaderboard
COMET-22 is an ensemble machine translation evaluation metric combining a COMET estimator model trained with Direct Assessments and a multitask model that predicts sentence-level scores and word-level OK/BAD tags. It demonstrates improved correlations compared to state-of-the-art metrics and increased robustness to critical errors.
Source: www.amazon.science.
Interactive version: theaggregate.ai/benchmark?slug=translation-en-over-set1-comet22 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.