GPT-6.1 Pro Sol: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1912 ± 29, rank #12 of 1636 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MineBench2212Elo Rating98.6
Arabic Broad Leaderboard - MMLU9.92Average Score (0-10)98.3
Arabic Broad Leaderboard - Translation (incl Dialects)8.06Average Score (0-10)96.2
AIMultiple - FinanceReasoning (Hard)90.34Accuracy (%, 238 hard FinanceReasoning questions)95.5
Arabic Broad Leaderboard9.05Average Score (0-10)91.6
Arabic Broad Leaderboard - Trust & Safety9.67Average Score (0-10)91.6
PRISM (1C:Enterprise) - Platform Tasks (B)901C platform tasks fully solved, run in headless 1C (%)91.5
AIMultiple - Text-to-SQL (Adjudicated)79.7Execution match with jury-credited equivalents and broken go87.7
Arabic Broad Leaderboard - RAG QA8.39Average Score (0-10)84
AIMultiple - Text-to-SQL (Strict Execution Match)51.3Execution match against BIRD gold (%, over correctly routed 83.6
PRISM (1C:Enterprise) - Algorithmic Tasks (A)93Algorithmic BSL tasks fully solved, run in OneScript (%)80.5
Tinybird AI SQL Benchmark - Exactness53.54Result exactness vs human reference queries (0-100)79

Interactive version: theaggregate.ai/model?slug=gpt-6-1-pro-sol · How It Works · Data refreshed daily, snapshot 2026-10-11.