Gemma 4 26B A4B (Non-reasoning): benchmark results
Provider: Google. Released 2026-04-02. Access: Open.
Unified ELO 1520 ± 1, rank #869 of 2032 rated models, from 56 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ObGynLongBench - Evidence-Only | 78.2 | Accuracy (%; supporting evidence only) | 87.5 |
| ObGynLongBench - History-Level EHR - L1 Single Evidence | 65 | Accuracy (%) | 81.2 |
| ObGynLongBench - Visit-Level EHR | 60.6 | Accuracy (%; same-day visit records) | 81.2 |
| AA Omniscience - Software Engineering (SWE) - PHP | 28 | Accuracy (%) | 69.1 |
| ObGynLongBench - History-Level EHR | 60.7 | Accuracy (%; full pre-decision EHR history) | 68.8 |
| ObGynLongBench - History-Level EHR - L2 Multi-Source Integration | 61.4 | Accuracy (%) | 68.8 |
| AA Terminal-Bench Hard | 25 | Accuracy (%) | 66 |
| AA Omniscience - Software Engineering (SWE) - Rust | 50 | Accuracy (%) | 59 |
| AA Humanity's Last Exam | 11.49 | Accuracy (%) | 56.9 |
| AA Omniscience - Software Engineering (SWE) - Go | 18 | Accuracy (%) | 56.5 |
| Artificial Analysis Intelligence Index | 13.13 | Intelligence Index | 54.3 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 28.18 | Accuracy (%) | 52.9 |
Interactive version: theaggregate.ai/model?slug=gemma-4-26b-a4b-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-26.