ModelChorusModelChorus
WyzwanieCzatRankingPrzesuńBenchmarki
Jak to działaAPIWarunki korzystania z usługiPolityka prywatności

Prawa autorskie 2026 MeetKai Inc.

Benchmarki/Functionary Swahili Large/Urdu (Pakistan) zadań

Functionary Swahili Large

8 zadań

Każdy poniższy wiersz to jedno zadanie benchmarkowe, na którym oceniano ten model. Kolumna Wynik przedstawia średnią ze wszystkich metryk zadania (dokładność, F1, dokładne dopasowanie itp.). Kliknij wiersz, aby przejrzeć poszczególne pytania i odpowiedzi modelu.

Średnia
59.1
WynikJęzykZadanieMetryki
79.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 79.1sample_len: 139.0
llm_judge_score: 79.1sample_len: 139.0
72.4Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 72.4sample_len: 387.0
f1_macro: 72.4sample_len: 387.0
71.4Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 71.4sample_len: 300.0
f1_macro: 71.4sample_len: 300.0
70.7Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 70.7sample_len: 102.0
f1_macro: 70.7sample_len: 102.0
69.0Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 69.0sample_len: 160.0
f1_macro: 69.0sample_len: 160.0
56.7Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 56.7sample_len: 323.0
llm_judge_score: 56.7sample_len: 323.0
31.5Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 31.5sample_len: 200.0
f1_macro: 31.5sample_len: 200.0
22.0Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 22.0sample_len: 200.0
llm_judge_score: 22.0sample_len: 200.0