Tongyi DeepResearch 30B A3B: benchmark results

Provider: Other. Released 2025-09-16. Access: Open.

Unified ELO 1687 ± 28, rank #351 of 2656 rated models, from 30 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
TurkBench - Bias84.2Accuracy (%)75.7
SnakeBench25.7TrueSkill Rating69.6
TurkBench - NLI75.69Accuracy (%)60.8
TurkBench - Toxicity98.28LLM-as-a-judge score (0-100)59.5
TurkBench - Metaphors and Idioms68Accuracy (%)58.1
TurkBench - Math29Accuracy (%)54.1
TurkBench - Sentiment Analysis45.99Accuracy (%)54.1
TurkBench - Turkish Vocabulary83Accuracy (%)51.4
TurkBench - Named Entity Recognition55.09Accuracy (%)45.9
TurkBench - Faithfulness85.57LLM-as-a-judge score (0-100)40.5
TurkBench - Summarization72.92LLM-as-a-judge score (0-100)40.5
TurkBench - Turkish General Knowledge64.58Accuracy (%)40.5

Interactive version: theaggregate.ai/model?slug=tongyi-deepresearch-30b-a3b · How It Works · Data refreshed daily, snapshot 2026-09-19.