SphinX — benchmark results
Alpha-VLLM's SPHINX multimodal model on a LLaMA-2-13B backbone, jointly mixing weights, tasks and visual embeddings for vision-language work (November 2023). Provider: Other. Released 2023-11-02. Access: Open.
Unified ELO 1472 ± 42, rank #903 of 1776 rated models, from 7 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 30.82 | Score | 82.3 |
| Open LLM Leaderboard - MMLU-Pro | 37.4 | Score | 79.7 |
| Open LLM Leaderboard - MuSR | 12.7 | Score | 69.6 |
| Open LLM Leaderboard - BBH | 34.71 | Score | 69.3 |
| Open LLM Leaderboard - IFEval | 57.25 | Score | 69.2 |
| Open LLM Leaderboard - GPQA | 6.38 | Score | 53.5 |
| MMMU Benchmark | 32.9 | Validation Score | 7.7 |
Interactive version: theaggregate.ai/model?slug=sphinx · How the rankings work · Data refreshed daily, snapshot 2026-07-22.