ModelChorusModelChorus
DesafíoChatTabla de ClasificaciónDeslizarEvaluacionesHistorial
Cómo funcionaAPITérminos de servicioPolítica de privacidad

Derechos de autor 2026 MeetKai Inc.

Evaluaciones/Functionary Swahili Large/Urdu (Pakistan) tareas

Functionary Swahili Large

8 tareas

Cada fila es una tarea de evaluación que este modelo realizó. La columna Puntuación promedia todas las métricas que reporta la tarea (precisión, F1, coincidencia exacta, etc.). Haz clic en una fila para explorar las preguntas individuales y las respuestas del modelo.

Promedio
59.1
PuntuaciónIdiomaTareaMétricas
79.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 79.1sample_len: 139.0
llm_judge_score: 79.1sample_len: 139.0
72.4Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 72.4sample_len: 387.0
f1_macro: 72.4sample_len: 387.0
71.4Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 71.4sample_len: 300.0
f1_macro: 71.4sample_len: 300.0
70.7Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 70.7sample_len: 102.0
f1_macro: 70.7sample_len: 102.0
69.0Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 69.0sample_len: 160.0
f1_macro: 69.0sample_len: 160.0
56.7Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 56.7sample_len: 323.0
llm_judge_score: 56.7sample_len: 323.0
31.5Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 31.5sample_len: 200.0
f1_macro: 31.5sample_len: 200.0
22.0Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 22.0sample_len: 200.0
llm_judge_score: 22.0sample_len: 200.0