BanglaSocialBench - Kinship Reasoning: leaderboard

Metric: Accuracy (%) on the 345 four-option Bengali kinship puzzles (multi-hop lineage descriptions; pick the correct kinship term), zero-shot Bangla prompts at temperature 0, culturally grounded scenarios written and verified by native Bangla speakers; higher is better. Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Flash92.46#237
2Claude Sonnet 488.98#194
3Gemini 2.0 Flash68.12#331
4GPT-4o67.83#333
5DeepSeek V3.164.06#260
6Llama 3.3 70B Instruct51.01#520
7GPT-4o Mini49.86#588
8Qwen 2.5 72B Instruct48.7#436
9Gemma 3 27B48.12#596
10Claude 3.5 Haiku44.06#553
11Gemma 3 12B42.61#666
12Llama 3 8B Instruct31.88#1115

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=banglasocialbench-kinship-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-11.