ModelChorusModelChorus
WyzwanieCzatRankingPrzesuńBenchmarki
Jak to działaAPIWarunki korzystania z usługiPolityka prywatności

Prawa autorskie 2026 MeetKai Inc.

Benchmarki/Functionary Swahili Large/urdu_factcheckbench

urdu_factcheckbench

Functionary Swahili Large · urdu claim · Urdu (Pakistan) · 0 próbek

Każdy wiersz na liście to jedno pytanie z benchmarku. Ikona znacznika lub krzyżyka pokazuje, czy odpowiedź modelu była zgodna z oczekiwaną. Kliknij wiersz, aby przeczytać pełny prompt, oczekiwaną odpowiedź i to, co model faktycznie wygenerował.

f1_macro
72.4
sample_len
387.0
Średnia
72.4
Nie zsynchronizowano jeszcze żadnych próbek dla poszczególnych pytań tego zadania.