ModelChorusModelChorus
تحديمحادثةلوحة التصنيفاسحبالمعاييرالسجل
كيف يعملAPIشروط الخدمةسياسة الخصوصية

حقوق النشر 2026 MeetKai Inc.

المعايير/GLM 5/كل المهام

GLM 5

12 مهام

كل صف أدناه هو مهمة تقييم واحدة جرى عليها هذا النموذج. عمود الدرجة يحسب متوسط كل المقاييس التي تبلّغ عنها المهمة (الدقة، F1، التطابق الكامل، إلخ). انقر على صف لتصفّح الأسئلة الفردية وإجابات النموذج.

المتوسط
57.0
الدرجةاللغةالمهمةالمقاييس
87.3Swahili (Tanzania)
swahili_sib200
swahili classification
f1_macro: 87.3sample_len: 204.0
f1_macro: 87.3sample_len: 204.0
85.7English (US)
english_gsm8k
english math
exact_match: 85.7sample_len: 1319.0
exact_match: 85.7sample_len: 1319.0
84.9French (France)
french_sib200
french classification
f1_macro: 84.9sample_len: 204.0
f1_macro: 84.9sample_len: 204.0
84.0English (US)
english_mgsm
english math
exact_match: 84.0sample_len: 250.0
exact_match: 84.0sample_len: 250.0
80.8Swahili (Tanzania)
swahili_afrimgsm
swahili afrimgsm
exact_match: 80.8sample_len: 250.0
exact_match: 80.8sample_len: 250.0
73.5Spanish (Spain)
spanish_xquad_es
spanish xquad es
exact_match: 63.6f1: 83.4sample_len: 1190.0
exact_match: 63.6f1: 83.4sample_len: 1190.0
70.1Swahili (Tanzania)
swahili_afrixnli
swahili nli
f1_macro: 70.1sample_len: 600.0
f1_macro: 70.1sample_len: 600.0
50.6English (US)
english_mmlu_pro
english mmlu pro
exact_match: 50.6sample_len: 2100.0
exact_match: 50.6sample_len: 2100.0
36.3English (US)
ifeval
ifeval
inst_level_loose_acc: 45.0inst_level_strict_acc: 43.0prompt_level_loose_acc: 29.8prompt_level_strict_acc: 27.5sample_len: 541.0
inst_level_loose_acc: 45.0inst_level_strict_acc: 43.0prompt_level_loose_acc: 29.8prompt_level_strict_acc: 27.5sample_len: 541.0
11.5Spanish (Spain)
spanish_global_mmlu
spanish mcq
f1_macro: 11.5sample_len: 400.0
f1_macro: 11.5sample_len: 400.0
10.3Spanish (Spain)
spanish_belebele
spanish mcq
f1_macro: 10.3sample_len: 900.0
f1_macro: 10.3sample_len: 900.0
9.3English (US)
english_belebele
english mcq
f1_macro: 9.3sample_len: 900.0
f1_macro: 9.3sample_len: 900.0