Step-3: benchmark results

Provider: StepFun. Access: API.

Unified ELO 1568 ± 1, rank #372 of 1392 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
FlagEval VQA - Geographic Reasoning58.2Score69.6
FlagEval VQA - Text Understanding (Chinese)73Score65.2
FlagEval VQA - Visual Puzzles29.5Score60.9
LLM2014 Logic 2025-0840.26Median Score52.3
FlagEval VQA - Long-tail Recognition35Score52.2
FlagEval VQA - Overall43.57Score52.2
FlagEval VQA - Scene Understanding53.8Score52.2
LLM2014 Logic 2025-0937.03Median Score48.9
LLM2014 Logic 2025-1037.92Median Score46.9
FlagEval VQA - Multi-Image Analysis42.5Score43.5
FlagEval VQA - Subject Knowledge55.9Score43.5
LLM2014 Logic 2025-1133.59Median Score40.4

Interactive version: theaggregate.ai/model?slug=step-3 · How It Works · Data refreshed daily, snapshot 2026-09-05.