Chocolatine-2-14B-Instruct-v2.0 — benchmark results
jpacifico's second-generation Chocolatine: a French-focused DPO fine-tune of a merged Phi-4 14B base targeting GPT-4o-mini-level French performance. Provider: Other. Released 2025-01-23. Access: Open.
Unified ELO 1498 ± 98, rank #808 of 1776 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| French LLM Leaderboard - BAC FR | 51.69 | Score (%) | 100 |
| Open LLM Leaderboard - MuSR | 23.9 | Score | 98.7 |
| Open LLM Leaderboard - GPQA | 18.34 | Score | 96.8 |
| Open LLM Leaderboard - BBH | 53.42 | Score | 96.1 |
| Open LLM Leaderboard - MATH Level 5 | 48.04 | Score | 95.6 |
| Open LLM Leaderboard - MMLU-Pro | 47.8 | Score | 92.8 |
| French LLM Leaderboard - GPQA FR | 41.76 | Score (%) | 88.9 |
| French LLM Leaderboard - Average | 48.71 | Average Score (%) | 85.2 |
| French LLM Leaderboard - IFEval FR | 52.69 | Score (%) | 72.2 |
| Open LLM Leaderboard - IFEval | 8.85 | Score | 1.6 |
Interactive version: theaggregate.ai/model?slug=chocolatine-2-14b-instruct-v2-0 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.