Chocolatine-2-14B-Instruct-v2.0 — benchmark results

jpacifico's second-generation Chocolatine: a French-focused DPO fine-tune of a merged Phi-4 14B base targeting GPT-4o-mini-level French performance. Provider: Other. Released 2025-01-23. Access: Open.

Unified ELO 1498 ± 98, rank #808 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
French LLM Leaderboard - BAC FR51.69Score (%)100
Open LLM Leaderboard - MuSR23.9Score98.7
Open LLM Leaderboard - GPQA18.34Score96.8
Open LLM Leaderboard - BBH53.42Score96.1
Open LLM Leaderboard - MATH Level 548.04Score95.6
Open LLM Leaderboard - MMLU-Pro47.8Score92.8
French LLM Leaderboard - GPQA FR41.76Score (%)88.9
French LLM Leaderboard - Average48.71Average Score (%)85.2
French LLM Leaderboard - IFEval FR52.69Score (%)72.2
Open LLM Leaderboard - IFEval8.85Score1.6

Interactive version: theaggregate.ai/model?slug=chocolatine-2-14b-instruct-v2-0 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.