ModelChorusModelChorus
تحديمحادثةلوحة التصنيفاسحبالمعاييرالسجل
كيف يعملAPIشروط الخدمةسياسة الخصوصية

حقوق النشر 2026 MeetKai Inc.

المعايير/GPT-oss-120B/Urdu (Pakistan) مهام

GPT-oss-120B

8 مهام

كل صف أدناه هو مهمة تقييم واحدة جرى عليها هذا النموذج. عمود الدرجة يحسب متوسط كل المقاييس التي تبلّغ عنها المهمة (الدقة، F1، التطابق الكامل، إلخ). انقر على صف لتصفّح الأسئلة الفردية وإجابات النموذج.

المتوسط
47.1
الدرجةاللغةالمهمةالمقاييس
87.1Urdu (Pakistan)
urdu_uquad
urdu qa
llm_judge_score: 87.1sample_len: 139.0
llm_judge_score: 87.1sample_len: 139.0
66.9Urdu (Pakistan)
urdu_freshqa
urdu qa
llm_judge_score: 66.9sample_len: 323.0
llm_judge_score: 66.9sample_len: 323.0
45.9Urdu (Pakistan)
urdu_facttool_qa
urdu claim
f1_macro: 45.9sample_len: 160.0
f1_macro: 45.9sample_len: 160.0
45.9Urdu (Pakistan)
urdu_factcheckbench
urdu claim
f1_macro: 45.9sample_len: 387.0
f1_macro: 45.9sample_len: 387.0
44.3Urdu (Pakistan)
urdu_bingcheck
urdu claim
f1_macro: 44.3sample_len: 102.0
f1_macro: 44.3sample_len: 102.0
37.6Urdu (Pakistan)
urdu_fake_news
urdu classification
f1_macro: 37.6sample_len: 300.0
f1_macro: 37.6sample_len: 300.0
28.6Urdu (Pakistan)
urdu_emotion_class
urdu classification
f1_macro: 28.6sample_len: 200.0
f1_macro: 28.6sample_len: 200.0
20.5Urdu (Pakistan)
urdu_simpleqa
urdu qa
llm_judge_score: 20.5sample_len: 200.0
llm_judge_score: 20.5sample_len: 200.0