Princeton NLP: AI model benchmarks

AI models from Princeton NLP. 48 models tracked, 48 with a unified ELO rating. Current best: gemma-2-9B-it-SimPO (ELO 1555, rank #577 overall). Most recent tracked release: 2024-08-22.

Rated models

RankModelProviderUnified ELOBenchmarks
577gemma-2-9B-it-SimPOPrinceton NLP1555 ± 1655
665gemma-2-9B-it-DPOPrinceton NLP1525 ± 1924
891Llama-3-Instruct-8B-ORPO-v0.2Princeton NLP1455 ± 2021
897Llama-3-Instruct-8B-SLiC-HF-v0.2Princeton NLP1454 ± 2021
911Llama-3-Instruct-8B-CPO-v0.2Princeton NLP1451 ± 2021
919Llama-3-Instruct-8B-SimPO-v0.2Princeton NLP1450 ± 1822
920Llama-3-Base-8B-SFT-SLiC-HFPrinceton NLP1450 ± 2021
928Llama-3-Base-8B-SFT-RDPOPrinceton NLP1449 ± 2021
933Llama 3 8B ProLong 64k InstructPrinceton NLP1448 ± 1729
945Llama-3-Instruct-8B-SLiC-HFPrinceton NLP1445 ± 1921
946Llama-3-Instruct-8B-RDPO-v0.2Princeton NLP1445 ± 1921
951Llama-3-Instruct-8B-ORPOPrinceton NLP1444 ± 2021
963Llama-3-Base-8B-SFT-KTOPrinceton NLP1442 ± 2021
975Llama 3 8B ProLong 512k InstructPrinceton NLP1439 ± 1729
990Llama-3-Instruct-8B-CPOPrinceton NLP1436 ± 2021

Interactive version: theaggregate.ai/company?slug=princeton-nlp · How It Works · Data refreshed daily, snapshot 2026-09-26.