SphinX — benchmark results

Alpha-VLLM's SPHINX multimodal model on a LLaMA-2-13B backbone, jointly mixing weights, tasks and visual embeddings for vision-language work (November 2023). Provider: Other. Released 2023-11-02. Access: Open.

Unified ELO 1472 ± 42, rank #903 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 530.82Score82.3
Open LLM Leaderboard - MMLU-Pro37.4Score79.7
Open LLM Leaderboard - MuSR12.7Score69.6
Open LLM Leaderboard - BBH34.71Score69.3
Open LLM Leaderboard - IFEval57.25Score69.2
Open LLM Leaderboard - GPQA6.38Score53.5
MMMU Benchmark32.9Validation Score7.7

Interactive version: theaggregate.ai/model?slug=sphinx · How the rankings work · Data refreshed daily, snapshot 2026-07-22.