ModelChorusModelChorus
DesafíoChatTabla de ClasificaciónDeslizarEvaluacionesHistorial
Cómo funcionaAPITérminos de servicioPolítica de privacidad

Derechos de autor 2026 MeetKai Inc.

Evaluaciones

Puntuaciones automáticas de lm-eval-harness en tareas multilingües. Más alto es mejor — toca una fila o celda para profundizar.

De un vistazo

Idiomas cubiertos
12
Mejor idioma
Albanian (Albania)
86.1%
Idioma más difícil
Yoruba (Nigeria)
46.7%
Cobertura de evaluación
13%
182 de 1407 celdas

Idiomas por dificultad

Puntuación promedio en todos los modelos

  • Yoruba (Nigeria)
    47
  • Spanish (Spain)
    47
  • Igbo (Nigeria)
    48
  • Hausa (Nigeria)
    51
  • Arabic (Saudi Arabia)
    53
  • Urdu (Pakistan)
    57
  • English (US)
    60
  • French (France)
    65
  • Portuguese (Portugal)
    76
  • Swahili (Tanzania)
    79
  • Ukrainian (Ukraine)
    82
  • Albanian (Albania)
    86

Mejor modelo por idioma

Líder por puntuación promedio (mín. 3 modelos)

  • Arabic (Saudi Arabia)
    Functionary Swahili Large
    69.4%
  • English (US)
    Functionary Swahili Large
    83.7%
  • Spanish (Spain)
    Functionary Swahili Large
    62.8%
  • French (France)
    GLM 5
    84.9%
  • Hausa (Nigeria)
    GPT-5 Nano
    55.0%
  • Portuguese (Portugal)
    GPT-5 Nano
    78.0%
  • Albanian (Albania)
    GPT-oss-120B
    87.3%
  • Swahili (Tanzania)
    Functionary Swahili Large
    89.9%
  • Ukrainian (Ukraine)
    Functionary Swahili Mini
    91.8%
  • Urdu (Pakistan)
    Functionary Swahili Mini
    67.2%

Tareas más difíciles

Promedio más bajo entre modelos calificados

  • hausa afriqa
    Hausa (Nigeria)
    12.5%
  • urdu simpleqa
    Urdu (Pakistan)
    21.2%
  • english belebele
    English (US)
    27.4%
  • urdu emotion class
    Urdu (Pakistan)
    29.7%
  • spanish global mmlu
    Spanish (Spain)
    33.1%
  • arabic tydiqa
    Arabic (Saudi Arabia)
    33.7%
  • spanish belebele
    Spanish (Spain)
    35.0%
  • ifeval
    English (US)
    37.7%

Tareas más fáciles

Promedio más alto entre modelos calificados

  • ukrainian polywrite
    Ukrainian (Ukraine)
    92.9%
  • albanian belebele
    Albanian (Albania)
    91.1%
  • french sib200
    French (France)
    88.9%
  • ukrainian sib200
    Ukrainian (Ukraine)
    88.4%
  • swahili sib200
    Swahili (Tanzania)
    87.4%
  • arabic sib200
    Arabic (Saudi Arabia)
    86.3%
  • english mgsm
    English (US)
    86.2%
  • albanian sib200
    Albanian (Albania)
    85.9%

Todos los modelos

#ModeloPromArabicEnglishSpanishFrenchHausaIgboPortugueseAlbanianSwahiliUkrainianUrduYorubaVer desglose
1
GPT-5 Nano
52/67
68.463.663.961.765.655.0--78.085.176.180.159.5--
2
Functionary Swahili Large
29/67
67.769.483.762.876.846.1--69.385.889.975.259.1--
3
Functionary Swahili Mini
22/67
62.243.423.6--54.350.8--75.885.485.991.867.2--
4
GPT-oss-120B
59.138.966.843.658.750.248.077.487.374.181.647.146.7
5
GLM 5
12/67
57.0--53.231.884.9--------79.4------

Cara a cara

Mostrar

Por idioma

Puntuación media en las tareas que ambos modelos puntuaron

  • Hausa4 tareas
    GPT-5 Nano
    59.7
    Functionary Swahili Large
    46.1
  • Portuguese3 tareas
    GPT-5 Nano
    76.7
    Functionary Swahili Large
    69.3
  • Arabic2 tareas
    GPT-5 Nano
    62.6
    Functionary Swahili Large
    69.4
  • Spanish1 tarea
    GPT-5 Nano
    67.7
    Functionary Swahili Large
    62.8
  • French3 tareas
    GPT-5 Nano
    72.7
    Functionary Swahili Large
    76.8
  • Swahili1 tarea
    GPT-5 Nano
    86.3
    Functionary Swahili Large
    89.9
  • English2 tareas
    GPT-5 Nano
    87.2
    Functionary Swahili Large
    83.7
  • Ukrainian2 tareas
    GPT-5 Nano
    73.8
    Functionary Swahili Large
    75.2
  • Albanian3 tareas
    GPT-5 Nano
    87.0
    Functionary Swahili Large
    85.8
  • Urdu8 tareas
    GPT-5 Nano
    59.5
    Functionary Swahili Large
    59.1

Diferencia por tarea

Diferencia de puntuación — barras a la derecha = GPT-5 Nano adelante, barras a la izquierda = Functionary Swahili Large adelante

  • Hausa
    • hausa afrimgsm
      +24.8
    • hausa afrixnli
      +16.5
    • hausa afriqa
      +14.0
    • hausa sib200
      -1.1
  • Urdu
    • urdu freshqa
      +18.6
    • urdu fake news
      -13.8
    • urdu uquad
      +10.1
    • urdu facttool qa
      -7.5
    • urdu factcheckbench
      -7.1
    • urdu bingcheck
      +6.8
    • urdu emotion class
      -3.0
    • urdu simpleqa
      -1.0
  • Portuguese
    • portuguese hatebr
      +16.4
    • portuguese hate speech
      +6.5
    • portuguese tweetsentbr
      -0.7
  • Arabic
    • arabic tydiqa
      -10.6
    • arabic sib200
      -3.1
  • French
    • french fquad
      -8.3
    • french mgsm
      -2.8
    • french sib200
      -1.1
  • Albanian
    • albanian sib200
      +6.6
    • albanian belebele
      -2.9
    • albanian global mmlu
      -0.2
  • Ukrainian
    • ukrainian sib200
      -6.5
    • ukrainian squad
      +3.8
  • Spanish
    • spanish xquad es
      +5.0
  • English
    • english gsm8k
      +4.6
    • english mgsm
      +2.4
  • Swahili
    • swahili sib200
      -3.6

Zonas de puntuación

GPT-5 Nano frente a la media de todos los demás modelos — 52 tareas en total

  • Liderando
    >+5pp
    21
  • Paridad
    ±5pp
    28
  • Detrás
    -5 to -20pp
    3
  • Muy detrás
    <-20pp
    0

Zonas de puntuación

Functionary Swahili Large frente a la media de todos los demás modelos — 29 tareas en total

  • Liderando
    >+5pp
    6
  • Paridad
    ±5pp
    15
  • Detrás
    -5 to -20pp
    7
  • Muy detrás
    <-20pp
    1