ModelChorusModelChorus
DesafíoChatTabla de ClasificaciónDeslizarEvaluacionesHistorial
Cómo funcionaAPITérminos de servicioPolítica de privacidad

Derechos de autor 2026 MeetKai Inc.

Evaluaciones/GPT-oss-120B/Urdu (Pakistan) tareas

GPT-oss-120B

8 tareas

Cada fila es una tarea de evaluación que este modelo realizó. La columna Puntuación promedia todas las métricas que reporta la tarea (precisión, F1, coincidencia exacta, etc.). Haz clic en una fila para explorar las preguntas individuales y las respuestas del modelo.

Promedio
47.1
PuntuaciónIdiomaTareaMétricas
87.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 87.1sample_len: 139.0
llm_judge_score: 87.1sample_len: 139.0
66.9Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 66.9sample_len: 323.0
llm_judge_score: 66.9sample_len: 323.0
45.9Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 45.9sample_len: 160.0
f1_macro: 45.9sample_len: 160.0
45.9Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 45.9sample_len: 387.0
f1_macro: 45.9sample_len: 387.0
44.3Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 44.3sample_len: 102.0
f1_macro: 44.3sample_len: 102.0
37.6Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 37.6sample_len: 300.0
f1_macro: 37.6sample_len: 300.0
28.6Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 28.6sample_len: 200.0
f1_macro: 28.6sample_len: 200.0
20.5Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 20.5sample_len: 200.0
llm_judge_score: 20.5sample_len: 200.0