ModelChorusModelChorus
تحديمحادثةلوحة التصنيفاسحبالمعاييرالسجل
كيف يعملAPIشروط الخدمةسياسة الخصوصية

حقوق النشر 2026 MeetKai Inc.

المعايير/GPT-oss-120B/English (US) مهام

GPT-oss-120B

5 مهام

كل صف أدناه هو مهمة تقييم واحدة جرى عليها هذا النموذج. عمود الدرجة يحسب متوسط كل المقاييس التي تبلّغ عنها المهمة (الدقة، F1، التطابق الكامل، إلخ). انقر على صف لتصفّح الأسئلة الفردية وإجابات النموذج.

المتوسط
66.8
الدرجةاللغةالمهمةالمقاييس
88.8English (US)
english_mgsm
english math
exact_match: 88.8sample_len: 250.0
exact_match: 88.8sample_len: 250.0
87.1English (US)
english_gsm8k
english math
exact_match: 87.1sample_len: 1319.0
exact_match: 87.1sample_len: 1319.0
74.4English (US)
english_mmlu_pro
english mmlu pro
exact_match: 74.4sample_len: 2100.0
exact_match: 74.4sample_len: 2100.0
44.3English (US)
ifeval
ifeval
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
39.6English (US)
english_belebele
english mcq
f1_macro: 39.6sample_len: 900.0
f1_macro: 39.6sample_len: 900.0