ModelChorusModelChorus
WyzwanieCzatRankingPrzesuńBenchmarki
Jak to działaAPIWarunki korzystania z usługiPolityka prywatności

Prawa autorskie 2026 MeetKai Inc.

Benchmarki/GPT-oss-120B/Arabic (Saudi Arabia) zadań

GPT-oss-120B

5 zadań

Każdy poniższy wiersz to jedno zadanie benchmarkowe, na którym oceniano ten model. Kolumna Wynik przedstawia średnią ze wszystkich metryk zadania (dokładność, F1, dokładne dopasowanie itp.). Kliknij wiersz, aby przejrzeć poszczególne pytania i odpowiedzi modelu.

Średnia
38.9
WynikJęzykZadanieMetryki
85.9Arabic (Saudi Arabia)
arabic_sib200
arabic classification
f1_macro: 85.9sample_len: 204.0
f1_macro: 85.9sample_len: 204.0
43.2Arabic (Saudi Arabia)
arabic_tydiqa
arabic qa
exact_match: 32.5f1: 53.9sample_len: 921.0
exact_match: 32.5f1: 53.9sample_len: 921.0
32.9Arabic (Saudi Arabia)
arabic_belebele
arabic mcq
f1_macro: 32.9sample_len: 900.0
f1_macro: 32.9sample_len: 900.0
17.5Arabic (Saudi Arabia)
arabic_aratrust
arabic mcq
f1_macro: 17.5sample_len: 522.0
f1_macro: 17.5sample_len: 522.0
14.8Arabic (Saudi Arabia)
arabic_mmlu
arabic mcq
f1_macro: 14.8sample_len: 14316.0
f1_macro: 14.8sample_len: 14316.0