CharXiv-R: leaderboard

Reasoning split of CharXiv (Princeton, 2024): 1 short-answer question per chart that combines values across plotted elements, over 2,323 arXiv charts, GPT-4o-graded; GPT-4o 47.1%, humans 80.5%.

Source: arxiv.org.

Interactive version: theaggregate.ai/benchmark?slug=charxiv-r · How It Works · Data refreshed daily, snapshot 2026-09-05.