Princeton NLP: AI model benchmarks
AI models from Princeton NLP. 48 models tracked, 48 with a unified ELO rating. Current best: gemma-2-9B-it-SimPO (ELO 1555, rank #577 overall). Most recent tracked release: 2024-08-22.
Rated models
| Rank | Model | Provider | Unified ELO | Benchmarks |
|---|---|---|---|---|
| 577 | gemma-2-9B-it-SimPO | Princeton NLP | 1555 ± 16 | 55 |
| 665 | gemma-2-9B-it-DPO | Princeton NLP | 1525 ± 19 | 24 |
| 891 | Llama-3-Instruct-8B-ORPO-v0.2 | Princeton NLP | 1455 ± 20 | 21 |
| 897 | Llama-3-Instruct-8B-SLiC-HF-v0.2 | Princeton NLP | 1454 ± 20 | 21 |
| 911 | Llama-3-Instruct-8B-CPO-v0.2 | Princeton NLP | 1451 ± 20 | 21 |
| 919 | Llama-3-Instruct-8B-SimPO-v0.2 | Princeton NLP | 1450 ± 18 | 22 |
| 920 | Llama-3-Base-8B-SFT-SLiC-HF | Princeton NLP | 1450 ± 20 | 21 |
| 928 | Llama-3-Base-8B-SFT-RDPO | Princeton NLP | 1449 ± 20 | 21 |
| 933 | Llama 3 8B ProLong 64k Instruct | Princeton NLP | 1448 ± 17 | 29 |
| 945 | Llama-3-Instruct-8B-SLiC-HF | Princeton NLP | 1445 ± 19 | 21 |
| 946 | Llama-3-Instruct-8B-RDPO-v0.2 | Princeton NLP | 1445 ± 19 | 21 |
| 951 | Llama-3-Instruct-8B-ORPO | Princeton NLP | 1444 ± 20 | 21 |
| 963 | Llama-3-Base-8B-SFT-KTO | Princeton NLP | 1442 ± 20 | 21 |
| 975 | Llama 3 8B ProLong 512k Instruct | Princeton NLP | 1439 ± 17 | 29 |
| 990 | Llama-3-Instruct-8B-CPO | Princeton NLP | 1436 ± 20 | 21 |
Interactive version: theaggregate.ai/company?slug=princeton-nlp · How It Works · Data refreshed daily, snapshot 2026-09-26.