TimeSeriesExamAgent: leaderboard
Metric: Average accuracy (%, times 100): the unweighted mean of the five TimeSeriesExamAgent exam accuracies (MIT-BIH, PTB-XL, MIMIC-IV Waveform, YFinance, WeatherBench 2; 857 questions in all): multiple-choice questions generated by TimeSeriesExamAgent from real data (Claude Sonnet 4 templates verified by gpt-4o and filtered so that gpt-4o does not score below gpt-4o-mini), time series given as plots, default API parameters; higher is better. Source: arxiv.org. Saturation forecast: Around December 2027. 6 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 | 51.5 |
| 2 | Gemini 2.5 Pro | 51 |
| 3 | O3 Mini | 44.2 |
| 4 | Gemma 3 27B (IT) | 43 |
Interactive version: theaggregate.ai/benchmark?slug=timeseriesexamagent · How It Works · Data refreshed daily, snapshot 2026-10-07.