ModelChorusModelChorus
HamonChatLeaderboardSwipeMga BenchmarkKasaysayan
Paano ito gumaganaAPIMga Tuntunin ng SerbisyoPatakaran sa Privacy

Copyright 2026 MeetKai Inc.

Mga Benchmark/GPT-oss-120B/Urdu (Pakistan) mga gawain

GPT-oss-120B

8 mga gawain

Ang bawat row sa ibaba ay isang benchmark na gawain na sinuri ang modelong ito. Ina-average ng column na Score ang bawat metric na iniuulat ng gawain (katumpakan, F1, exact-match, atbp.). I-click ang isang row para i-browse ang mga indibidwal na tanong at mga tugon ng modelo.

Average
47.1
MarkaWikaGawainMga sukatan
87.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 87.1sample_len: 139.0
llm_judge_score: 87.1sample_len: 139.0
66.9Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 66.9sample_len: 323.0
llm_judge_score: 66.9sample_len: 323.0
45.9Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 45.9sample_len: 160.0
f1_macro: 45.9sample_len: 160.0
45.9Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 45.9sample_len: 387.0
f1_macro: 45.9sample_len: 387.0
44.3Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 44.3sample_len: 102.0
f1_macro: 44.3sample_len: 102.0
37.6Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 37.6sample_len: 300.0
f1_macro: 37.6sample_len: 300.0
28.6Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 28.6sample_len: 200.0
f1_macro: 28.6sample_len: 200.0
20.5Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 20.5sample_len: 200.0
llm_judge_score: 20.5sample_len: 200.0