AnFeng_v3_Avocet: benchmark results

Provider: Other. Access: Open.

Unified ELO 1530 ± 33, rank #936 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - HellaSwag67.79Accuracy (%)84.9
Open Chinese LLM - ARC Challenge59.3Accuracy (%)83.4
Open Chinese LLM - GSM8K55.88Accuracy (%)77.2
Open Chinese LLM Leaderboard62.75Average Score (%)75.4
Open Chinese LLM - CMMLU61.84Accuracy (%)71.5
Open Chinese LLM - TruthfulQA MC56.09Accuracy (%)65.9
Open Chinese LLM - WinoGrande64.25Accuracy (%)65.7
Open Chinese LLM - C-Eval Semantic74.13Accuracy (%)62.6
Open Portuguese LLM - ASSIN2 RTE64.54Macro F1 (%)22.4
Open Portuguese LLM - BLUEX9.6Accuracy (%)3.6
Open Portuguese LLM - ENEM3.15Accuracy (%)2.8
Open Portuguese LLM - OAB Exams0.41Accuracy (%)2.2

Interactive version: theaggregate.ai/model?slug=anfeng-v3-avocet · How It Works · Data refreshed daily, snapshot 2026-09-19.