ModelChorusModelChorus
WyzwanieCzatRankingPrzesuńBenchmarki
Jak to działaAPIWarunki korzystania z usługiPolityka prywatności

Prawa autorskie 2026 MeetKai Inc.

Benchmarki/GPT-oss-120B/English (US) zadań

GPT-oss-120B

5 zadań

Każdy poniższy wiersz to jedno zadanie benchmarkowe, na którym oceniano ten model. Kolumna Wynik przedstawia średnią ze wszystkich metryk zadania (dokładność, F1, dokładne dopasowanie itp.). Kliknij wiersz, aby przejrzeć poszczególne pytania i odpowiedzi modelu.

Średnia
66.8
WynikJęzykZadanieMetryki
88.8English (US)
english_mgsm
english math
exact_match: 88.8sample_len: 250.0
exact_match: 88.8sample_len: 250.0
87.1English (US)
english_gsm8k
english math
exact_match: 87.1sample_len: 1319.0
exact_match: 87.1sample_len: 1319.0
74.4English (US)
english_mmlu_pro
english mmlu pro
exact_match: 74.4sample_len: 2100.0
exact_match: 74.4sample_len: 2100.0
44.3English (US)
ifeval
ifeval
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
39.6English (US)
english_belebele
english mcq
f1_macro: 39.6sample_len: 900.0
f1_macro: 39.6sample_len: 900.0