Puntuaciones automáticas de lm-eval-harness en tareas multilingües. Más alto es mejor — toca una fila o celda para profundizar.
Puntuación promedio en todos los modelos
Líder por puntuación promedio (mín. 3 modelos)
Promedio más bajo entre modelos calificados
Promedio más alto entre modelos calificados
| # | Modelo | Prom | Arabic | English | Spanish | French | Hausa | Igbo | Portuguese | Albanian | Swahili | Ukrainian | Urdu | Yoruba | Ver desglose |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5 Nano 52/67 | 68.4 | 63.6 | 63.9 | 61.7 | 65.6 | 55.0 | -- | 78.0 | 85.1 | 76.1 | 80.1 | 59.5 | -- | |
| 2 | Functionary Swahili Large 29/67 | 67.7 | 69.4 | 83.7 | 62.8 | 76.8 | 46.1 | -- | 69.3 | 85.8 | 89.9 | 75.2 | 59.1 | -- | |
| 3 | Functionary Swahili Mini 22/67 | 62.2 | 43.4 | 23.6 | -- | 54.3 | 50.8 | -- | 75.8 | 85.4 | 85.9 | 91.8 | 67.2 | -- | |
| 4 | GPT-oss-120B | 59.1 | 38.9 | 66.8 | 43.6 | 58.7 | 50.2 | 48.0 | 77.4 | 87.3 | 74.1 | 81.6 | 47.1 | 46.7 | |
| 5 | GLM 5 12/67 | 57.0 | -- | 53.2 | 31.8 | 84.9 | -- | -- | -- | -- | 79.4 | -- | -- | -- |
Puntuación media en las tareas que ambos modelos puntuaron
Diferencia de puntuación — barras a la derecha = GPT-5 Nano adelante, barras a la izquierda = Functionary Swahili Large adelante
GPT-5 Nano frente a la media de todos los demás modelos — 52 tareas en total
Functionary Swahili Large frente a la media de todos los demás modelos — 29 tareas en total