failspy: AI model benchmarks
AI models from failspy. 4 models tracked, 4 with a unified ELO rating. Current best: Llama-3-8B-Instruct-abliterated-v2 (ELO 1427, rank #1102 overall). Most recent tracked release: 2024-06-01.
Rated models
| Rank | Model | Provider | Unified ELO | Benchmarks |
|---|---|---|---|---|
| 1102 | Llama-3-8B-Instruct-abliterated-v2 | failspy | 1427 ± 15 | 41 |
| 1186 | Meta-Llama-3-8B-Instruct-abliterated-v3 | failspy | 1406 ± 15 | 45 |
| 1290 | Phi-3-medium-4k-instruct-abliterated-v3 | failspy | 1378 ± 19 | 27 |
| 1369 | Llama 3 8B Instruct MopeyMule | failspy | 1345 ± 31 | 18 |
Interactive version: theaggregate.ai/company?slug=failspy · How It Works · Data refreshed daily, snapshot 2026-10-07.