SphinX: benchmark results

Alpha-VLLM's SPHINX multimodal model on a LLaMA-2-13B backbone, jointly mixing weights, tasks and visual embeddings for vision-language work (November 2023). Provider: Other. Released 2023-11-02. Access: Open.

Unified ELO 1449 ± 1, rank #1063 of 1553 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 530.82Score82.3
Open LLM Leaderboard - MMLU-Pro37.4Score79.7
Open LLM Leaderboard - MuSR12.7Score69.6
Open LLM Leaderboard - BBH34.71Score69.3
Open LLM Leaderboard - IFEval57.25Score69.1
Open LLM Leaderboard - GPQA6.38Score53.5
MMMU Benchmark32.9Validation Score7.7

Interactive version: theaggregate.ai/model?slug=sphinx · How It Works · Data refreshed daily, snapshot 2026-09-08.