Benchmarki/ GPT-5 Nano / English (US) zadań Każdy poniższy wiersz to jedno zadanie benchmarkowe, na którym oceniano ten model. Kolumna Wynik przedstawia średnią ze wszystkich metryk zadania (dokładność, F1, dokładne dopasowanie itp.). Kliknij wiersz, aby przejrzeć poszczególne pytania i odpowiedzi modelu.
Wynik Język Zadanie Metryki 87.3 English (US) english_gsm8k
english math
exact_match: 87.3sample_len: 1319.0
exact_match: 87.3sample_len: 1319.0
87.2 English (US) english_mgsm
english math
exact_match: 87.2sample_len: 250.0
exact_match: 87.2sample_len: 250.0
61.6 English (US) english_mmlu_pro
english mmlu pro
exact_match: 61.6sample_len: 2100.0
exact_match: 61.6sample_len: 2100.0
51.2 English (US) english_belebele
english mcq
f1_macro: 51.2sample_len: 900.0
f1_macro: 51.2sample_len: 900.0
32.5 English (US) ifeval
ifeval
inst_level_loose_acc: 39.3inst_level_strict_acc: 38.5prompt_level_loose_acc: 26.6prompt_level_strict_acc: 25.7sample_len: 541.0
inst_level_loose_acc: 39.3inst_level_strict_acc: 38.5prompt_level_loose_acc: 26.6prompt_level_strict_acc: 25.7sample_len: 541.0