ModelChorusModelChorus
SfidëBisedëKlasifikimiRrëshqitTestimeHistoria
Si funksiononAPIKushtet e ShërbimitPolitika e Privatësisë

E drejta e autorit 2026 MeetKai Inc.

Testime

Pikë të automatizuara lm-eval-harness në detyra shumëgjuhëshe. Më e lartë është më mirë — prek një rresht ose qelizë për të zbërthyer.

Me një vështrim

Gjuhët e mbuluara
12
Gjuha më e mirë
Albanian (Albania)
86.1%
Gjuha më e vështirë
Yoruba (Nigeria)
46.7%
Mbulimi i vlerësimit
13%
182 nga 1407 qeliza

Gjuhët sipas vështirësisë

Pikët mesatare në të gjitha modelet

  • Yoruba (Nigeria)
    47
  • Spanish (Spain)
    47
  • Igbo (Nigeria)
    48
  • Hausa (Nigeria)
    51
  • Arabic (Saudi Arabia)
    53
  • Urdu (Pakistan)
    57
  • English (US)
    60
  • French (France)
    65
  • Portuguese (Portugal)
    76
  • Swahili (Tanzania)
    79
  • Ukrainian (Ukraine)
    82
  • Albanian (Albania)
    86

Modeli më i mirë për gjuhë

Lider sipas pikëve mesatare (min. 3 modele)

  • Arabic (Saudi Arabia)
    Functionary Swahili Large
    69.4%
  • English (US)
    Functionary Swahili Large
    83.7%
  • Spanish (Spain)
    Functionary Swahili Large
    62.8%
  • French (France)
    GLM 5
    84.9%
  • Hausa (Nigeria)
    GPT-5 Nano
    55.0%
  • Portuguese (Portugal)
    GPT-5 Nano
    78.0%
  • Albanian (Albania)
    GPT-oss-120B
    87.3%
  • Swahili (Tanzania)
    Functionary Swahili Large
    89.9%
  • Ukrainian (Ukraine)
    Functionary Swahili Mini
    91.8%
  • Urdu (Pakistan)
    Functionary Swahili Mini
    67.2%

Detyrat më të vështira

Mesatarja më e ulët midis modeleve kualifikuese

  • hausa afriqa
    Hausa (Nigeria)
    12.5%
  • urdu simpleqa
    Urdu (Pakistan)
    21.2%
  • english belebele
    English (US)
    27.4%
  • urdu emotion class
    Urdu (Pakistan)
    29.7%
  • spanish global mmlu
    Spanish (Spain)
    33.1%
  • arabic tydiqa
    Arabic (Saudi Arabia)
    33.7%
  • spanish belebele
    Spanish (Spain)
    35.0%
  • ifeval
    English (US)
    37.7%

Detyrat më të lehta

Mesatarja më e lartë midis modeleve kualifikuese

  • ukrainian polywrite
    Ukrainian (Ukraine)
    92.9%
  • albanian belebele
    Albanian (Albania)
    91.1%
  • french sib200
    French (France)
    88.9%
  • ukrainian sib200
    Ukrainian (Ukraine)
    88.4%
  • swahili sib200
    Swahili (Tanzania)
    87.4%
  • arabic sib200
    Arabic (Saudi Arabia)
    86.3%
  • english mgsm
    English (US)
    86.2%
  • albanian sib200
    Albanian (Albania)
    85.9%

Të gjitha modelet

#ModeliMesArabicEnglishSpanishFrenchHausaIgboPortugueseAlbanianSwahiliUkrainianUrduYorubaShiko zbërthimin
1
GPT-5 Nano
52/67
68.463.663.961.765.655.0--78.085.176.180.159.5--
2
Functionary Swahili Large
29/67
67.769.483.762.876.846.1--69.385.889.975.259.1--
3
Functionary Swahili Mini
22/67
62.243.423.6--54.350.8--75.885.485.991.867.2--
4
GPT-oss-120B
59.138.966.843.658.750.248.077.487.374.181.647.146.7
5
GLM 5
12/67
57.0--53.231.884.9--------79.4------

Ballë për ballë

Shfaq

Sipas gjuhës

Pikët mesatare në detyrat që të dy modelet vlerësuan

  • Hausa4 detyra
    GPT-5 Nano
    59.7
    Functionary Swahili Large
    46.1
  • Portuguese3 detyra
    GPT-5 Nano
    76.7
    Functionary Swahili Large
    69.3
  • Arabic2 detyra
    GPT-5 Nano
    62.6
    Functionary Swahili Large
    69.4
  • Spanish1 detyrë
    GPT-5 Nano
    67.7
    Functionary Swahili Large
    62.8
  • French3 detyra
    GPT-5 Nano
    72.7
    Functionary Swahili Large
    76.8
  • Swahili1 detyrë
    GPT-5 Nano
    86.3
    Functionary Swahili Large
    89.9
  • English2 detyra
    GPT-5 Nano
    87.2
    Functionary Swahili Large
    83.7
  • Ukrainian2 detyra
    GPT-5 Nano
    73.8
    Functionary Swahili Large
    75.2
  • Albanian3 detyra
    GPT-5 Nano
    87.0
    Functionary Swahili Large
    85.8
  • Urdu8 detyra
    GPT-5 Nano
    59.5
    Functionary Swahili Large
    59.1

Hendeku për çdo detyrë

Diferenca në pikë — shiritat djathtas = GPT-5 Nano përpara, shiritat majtas = Functionary Swahili Large përpara

  • Hausa
    • hausa afrimgsm
      +24.8
    • hausa afrixnli
      +16.5
    • hausa afriqa
      +14.0
    • hausa sib200
      -1.1
  • Urdu
    • urdu freshqa
      +18.6
    • urdu fake news
      -13.8
    • urdu uquad
      +10.1
    • urdu facttool qa
      -7.5
    • urdu factcheckbench
      -7.1
    • urdu bingcheck
      +6.8
    • urdu emotion class
      -3.0
    • urdu simpleqa
      -1.0
  • Portuguese
    • portuguese hatebr
      +16.4
    • portuguese hate speech
      +6.5
    • portuguese tweetsentbr
      -0.7
  • Arabic
    • arabic tydiqa
      -10.6
    • arabic sib200
      -3.1
  • French
    • french fquad
      -8.3
    • french mgsm
      -2.8
    • french sib200
      -1.1
  • Albanian
    • albanian sib200
      +6.6
    • albanian belebele
      -2.9
    • albanian global mmlu
      -0.2
  • Ukrainian
    • ukrainian sib200
      -6.5
    • ukrainian squad
      +3.8
  • Spanish
    • spanish xquad es
      +5.0
  • English
    • english gsm8k
      +4.6
    • english mgsm
      +2.4
  • Swahili
    • swahili sib200
      -3.6

Zonat e pikëve

GPT-5 Nano kundër mesatares së të gjithë modeleve të tjerë — gjithsej 52 detyra

  • Në krye
    >+5pp
    21
  • Barazi
    ±5pp
    28
  • Prapa
    -5 to -20pp
    3
  • Shumë prapa
    <-20pp
    0

Zonat e pikëve

Functionary Swahili Large kundër mesatares së të gjithë modeleve të tjerë — gjithsej 29 detyra

  • Në krye
    >+5pp
    6
  • Barazi
    ±5pp
    15
  • Prapa
    -5 to -20pp
    7
  • Shumë prapa
    <-20pp
    1