Pontuações automatizadas do lm-eval-harness em tarefas multilingues. Mais alto é melhor — toque numa linha ou célula para ver detalhes.
Pontuação média de todos os modelos
Líder por pontuação média (mín. 3 modelos)
Média mais baixa entre os modelos qualificados
Média mais alta entre os modelos qualificados
| # | Modelo | Méd | Arabic | English | Spanish | French | Hausa | Igbo | Portuguese | Albanian | Swahili | Ukrainian | Urdu | Yoruba | Ver detalhamento |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5 Nano 52/67 | 68.4 | 63.6 | 63.9 | 61.7 | 65.6 | 55.0 | -- | 78.0 | 85.1 | 76.1 | 80.1 | 59.5 | -- | |
| 2 | Functionary Swahili Large 29/67 | 67.7 | 69.4 | 83.7 | 62.8 | 76.8 | 46.1 | -- | 69.3 | 85.8 | 89.9 | 75.2 | 59.1 | -- | |
| 3 | Functionary Swahili Mini 22/67 | 62.2 | 43.4 | 23.6 | -- | 54.3 | 50.8 | -- | 75.8 | 85.4 | 85.9 | 91.8 | 67.2 | -- | |
| 4 | GPT-oss-120B | 59.1 | 38.9 | 66.8 | 43.6 | 58.7 | 50.2 | 48.0 | 77.4 | 87.3 | 74.1 | 81.6 | 47.1 | 46.7 | |
| 5 | GLM 5 12/67 | 57.0 | -- | 53.2 | 31.8 | 84.9 | -- | -- | -- | -- | 79.4 | -- | -- | -- |
Pontuação média nas tarefas que ambos os modelos pontuaram
Diferença de pontuação — barras à direita = GPT-5 Nano à frente, barras à esquerda = Functionary Swahili Large à frente
GPT-5 Nano vs. a média de todos os outros modelos — 52 tarefas no total
Functionary Swahili Large vs. a média de todos os outros modelos — 29 tarefas no total