ModelChorusModelChorus
DesafioConversaTabela de classificaçãoDeslizarBenchmarksHistórico
Como funcionaAPITermos de serviçoPolítica de privacidade

Direitos de autor 2026 MeetKai Inc.

Benchmarks/GPT-oss-120B/urdu_freshqa

urdu_freshqa

GPT-oss-120B · urdu qa · Urdu (Pakistan) · 0 amostras

Cada linha da lista é uma pergunta do benchmark. O ícone de marca ou cruz indica se a resposta do modelo correspondeu ao alvo; clique numa linha para ler o pedido completo, a resposta esperada e o que o modelo realmente produziu.

llm_judge_score
66.9
sample_len
323.0
Média
66.9
Ainda não foram sincronizadas amostras por pergunta para esta tarefa.