RABBITS: leaderboard

Bias assessment for Indian text-based systems: evaluates medical LLMs for bias and accuracy on MedMCQA and MedQA with culturally-adapted questions.

Metric: B4BQA Score (%). Source: huggingface.co. Status: saturated. 23 models tracked.

Top models

#ModelScore
1GPT-499.71
2GPT-4o99.61
3GPT-3.5 Turbo99.43
4Claude Opus99.14
5Qwen-Qwen2-72B99.05
6mistralai-Mixtral-8x22B-v0.198.66
7meta-llama-Meta-Llama-3-70B98.57
8CohereForAI-c4ai-command-r-plus98.28
901-ai-Yi-1.5-34B97.81
10aaditya-Llama3-OpenBioLLM-70B97.42

Interactive version: theaggregate.ai/benchmark?slug=rabbits · How It Works · Data refreshed daily, snapshot 2026-09-05.