CorpusQA (128K) - Financial (Chinese): leaderboard

Metric: Accuracy (%; 83 questions over Chinese financial reports, 128K-token corpora, DeepSeek-V3 judge). Source: arxiv.org. Saturation forecast: Estimated already saturated. 8 models tracked.

Top models

#ModelScore
1GPT-593.98
2GPT-5 Mini93.98
3Qwen 3 235B A22B 2507 (Thinking)90.36
4Gemini 2.5 Pro89.16
5Gemini 2.5 Flash83.13
6DeepSeek R1 052883.13
7Qwen 3 30B A3B 2507 (Thinking)83.13
8MiniMax M1 80k73.49

Interactive version: theaggregate.ai/benchmark?slug=corpusqa-128k-financial-chinese · How It Works · Data refreshed daily, snapshot 2026-09-25.