TimeSeriesExamAgent: leaderboard

Metric: Average accuracy (%, times 100): the unweighted mean of the five TimeSeriesExamAgent exam accuracies (MIT-BIH, PTB-XL, MIMIC-IV Waveform, YFinance, WeatherBench 2; 857 questions in all): multiple-choice questions generated by TimeSeriesExamAgent from real data (Claude Sonnet 4 templates verified by gpt-4o and filtered so that gpt-4o does not score below gpt-4o-mini), time series given as plots, default API parameters; higher is better. Source: arxiv.org. Saturation forecast: Around December 2027. 6 models tracked.

Top models

#ModelScore
1GPT-551.5
2Gemini 2.5 Pro51
3O3 Mini44.2
4Gemma 3 27B (IT)43

Interactive version: theaggregate.ai/benchmark?slug=timeseriesexamagent · How It Works · Data refreshed daily, snapshot 2026-10-07.