ModelChorusModelChorus
DesafioConversaTabela de classificaçãoDeslizarBenchmarksHistórico
Como funcionaAPITermos de serviçoPolítica de privacidade

Direitos de autor 2026 MeetKai Inc.

Benchmarks/Functionary Swahili Large/Urdu (Pakistan) tarefas

Functionary Swahili Large

8 tarefas

Cada linha abaixo é uma única tarefa de benchmark em que este modelo foi avaliado. A coluna Pontuação calcula a média de todas as métricas que a tarefa reporta (precisão, F1, correspondência exata, etc.). Clique numa linha para explorar as perguntas individuais e as respostas do modelo.

Média
59.1
PontuaçãoIdiomaTarefaMétricas
79.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 79.1sample_len: 139.0
llm_judge_score: 79.1sample_len: 139.0
72.4Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 72.4sample_len: 387.0
f1_macro: 72.4sample_len: 387.0
71.4Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 71.4sample_len: 300.0
f1_macro: 71.4sample_len: 300.0
70.7Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 70.7sample_len: 102.0
f1_macro: 70.7sample_len: 102.0
69.0Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 69.0sample_len: 160.0
f1_macro: 69.0sample_len: 160.0
56.7Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 56.7sample_len: 323.0
llm_judge_score: 56.7sample_len: 323.0
31.5Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 31.5sample_len: 200.0
f1_macro: 31.5sample_len: 200.0
22.0Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 22.0sample_len: 200.0
llm_judge_score: 22.0sample_len: 200.0