SphinX: benchmark results
Alpha-VLLM's SPHINX multimodal model on a LLaMA-2-13B backbone, jointly mixing weights, tasks and visual embeddings for vision-language work (November 2023). Provider: Other. Released 2023-11-02. Access: Open.
Unified ELO 1449 ± 1, rank #1063 of 1553 rated models, from 7 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 30.82 | Score | 82.3 |
| Open LLM Leaderboard - MMLU-Pro | 37.4 | Score | 79.7 |
| Open LLM Leaderboard - MuSR | 12.7 | Score | 69.6 |
| Open LLM Leaderboard - BBH | 34.71 | Score | 69.3 |
| Open LLM Leaderboard - IFEval | 57.25 | Score | 69.1 |
| Open LLM Leaderboard - GPQA | 6.38 | Score | 53.5 |
| MMMU Benchmark | 32.9 | Validation Score | 7.7 |
Interactive version: theaggregate.ai/model?slug=sphinx · How It Works · Data refreshed daily, snapshot 2026-09-08.