Article
人工知能:AI能力を評価するための専門家レベルの学術的問題のベンチマーク
Nature 649, 8099 doi: 10.1038/s41586-025-09962-4
大規模言語モデル(LLM)の能力の急速な進歩を追跡するには、ベンチマークが重要なツールとなる。しかしベンチマークは、難易度の点でこの進歩について行けておらず、LLMは現在、マルチタスク言語理解(MMLU)などの一般的なベンチマーク上で90%を上回る精度に達していて、情報に基づいた測定を最先端のLLMの能力に対して行うには限界がある。これに応えて今回我々は、「人類の最終試験(HLE:Humanity’s Last Exam)」を導入する。これは、人間の知識の最前線にあるマルチモーダルベンチマークであり、専門家レベルのクローズドエンド型問題の学術的ベンチマークとして設計されたもので、幅広い分野をカバーする。HLEは、数学、人文科学、自然科学を含む、数十の分野にまたがる2500問からなる。HLEは、世界中にいる各分野の専門家により開発され、自動採点に適した多肢選択式問題と短答式問題からなる。各問題には、明確かつ容易に検証可能な既知の解答が存在するが、インターネットを検索して速やかに回答することはできない。最先端のLLMは、HLE上で精度と較正の低さを示しており、クローズドエンド型の学術問題について現状のLLMの能力と人間の専門家レベルとの間に大きなギャップがあることが浮き彫りになった。我々は、モデル能力の明確な理解に基づく研究と政策決定に情報を提供するために、HLEをhttps://lastexam.aiに公開する。

