CLIP-CC-Bench: leaderboard

Metric: Mean HM-CF similarity (0-100): harmonic mean of paragraph-level cosine similarity and sentence-level greedy-matching F1 between the generated description and the expert-written reference, averaged over the 199 scored clips of the 200-clip set of 90-second movie clips and over five MTEB embedding-model judges (GTE-Qwen2-7B, KaLM-Gemma3-12B, Llama-Embed-Nemotron-8B, NV-Embed-v2, Qwen3-Embedding-8B), printed 0-1 and scaled by 100; uniform prompt, greedy decoding. Source: arxiv.org. Saturation forecast: Around December 2026. 17 models tracked.

Top models

#ModelScore
1InternVL2-8B58

Interactive version: theaggregate.ai/benchmark?slug=clip-cc-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.