何が起きたか

OpenAIのプレプリントでは、PaperBenchがICML 2024の20本の論文を対象に、研究内容の理解から実験の実行までを評価する枠組みとして説明されている。あわせて、8,316件の個別に採点可能な課題と、LLMを使った採点手法、派生版のPaperBench Code-Dev、JudgeEvalが示されている。