ModelChorusModelChorus
HamonChatLeaderboardSwipeMga BenchmarkKasaysayan
Paano ito gumaganaAPIMga Tuntunin ng SerbisyoPatakaran sa Privacy

Copyright 2026 MeetKai Inc.

Mga Benchmark/GPT-oss-120B/English (US) mga gawain

GPT-oss-120B

5 mga gawain

Ang bawat row sa ibaba ay isang benchmark na gawain na sinuri ang modelong ito. Ina-average ng column na Score ang bawat metric na iniuulat ng gawain (katumpakan, F1, exact-match, atbp.). I-click ang isang row para i-browse ang mga indibidwal na tanong at mga tugon ng modelo.

Average
66.8
MarkaWikaGawainMga sukatan
88.8English (US)
english_mgsm
english math
exact_match: 88.8sample_len: 250.0
exact_match: 88.8sample_len: 250.0
87.1English (US)
english_gsm8k
english math
exact_match: 87.1sample_len: 1319.0
exact_match: 87.1sample_len: 1319.0
74.4English (US)
english_mmlu_pro
english mmlu pro
exact_match: 74.4sample_len: 2100.0
exact_match: 74.4sample_len: 2100.0
44.3English (US)
ifeval
ifeval
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
inst_level_loose_acc: 56.0inst_level_strict_acc: 45.8prompt_level_loose_acc: 44.0prompt_level_strict_acc: 31.6sample_len: 541.0
39.6English (US)
english_belebele
english mcq
f1_macro: 39.6sample_len: 900.0
f1_macro: 39.6sample_len: 900.0