AIベンチマーク大規模言語モデル性能評価MMLUMMLUは大規模言語モデルの総合的な知識と問題解決能力を測るための代表的なベンチマークテストです。人文科学や社会科学、STEM分野など幅広い専門知識を問う選択式問題で構成されており、AIの学力測定における標準指標として広く利用されています。21 views · ♥ 0