GPT-4.1 Mini — benchmark results

OpenAI's mid-size GPT-4.1 tier with a 1M-token context, cheaper and lower-latency than GPT-4o at similar quality (April 2025). Provider: OpenAI. Released 2025-04-14. Access: API.

Unified ELO 1547 ± 6, rank #626 of 1776 rated models, from 1062 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BlueBench - Chatbot Abilities97.55Score (%)100
BlueBench - RAG General54.58Score (%)100
EuroEval Bosnian63.93Average Score (%)100
EuroEval Bosnian NLU - MMS BS56.43Sentiment classification Score (%)100
Galileo Agent - Telecom Accuracy64Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-elementary school65.1Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-elementary school; Avg78.1Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-high school47.3Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-algebra82.4Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-algebra; Avg95.5Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-arithmetic57.7Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-arithmetic; Avg73.8Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=gpt-4-1-mini · How the rankings work · Data refreshed daily, snapshot 2026-07-22.