何が起きたか
OpenAIは2025年10月5日、AIモデルの実世界の経済価値タスクにおける性能を評価するベンチマーク「GDPval」を発表した。このベンチマークは、米国労働統計局の作業活動の大半をカバーし、米国GDPに寄与する上位9セクターの44職種を対象としている。タスクは平均14年の経験を持つ業界専門家の代表的な仕事から構築された。
詳細
GDPvalは、米国労働統計局の作業活動の大半をカバーし、米国GDPに寄与する上位9セクターの44職種を対象としている。タスクは平均14年の経験を持つ業界専門家の代表的な仕事から構築された。OpenAIは、フロンティアモデルの性能が時間とともにおおむね直線的に向上しており、現在の最先端モデルは成果物品質において業界専門家に近づいているとしている。また、人間の監督と組み合わせることで、専門家なしでタスクをより安価かつ迅速に実行できる可能性を分析した。さらに、推論努力の増加、タスクコンテキストの増加、スキャフォールディングの改善がモデル性能を向上させることを示した。220タスクのゴールドサブセットをオープンソース化し、evals.openai.comで公開自動採点サービスを提供する。
Key Facts
| OpenAIは2025年10月5日にGDPvalを発表した。 | [1] |
| GDPvalは米国労働統計局の作業活動の大半をカバーし、44職種・9セクターを対象とする。 | [1] |
| タスクは平均14年の経験を持つ業界専門家の代表的な仕事から構築された。 | [1] |
| フロンティアモデルの性能は時間とともにおおむね直線的に向上しており、現在の最先端モデルは成果物品質において業界専門家に近づいている。 | [1] |
| 220タスクのゴールドサブセットがオープンソース化され、evals.openai.comで公開自動採点サービスが提供される。 | [1] |
本紙の見方
今回の発表は、AIモデルの性能評価を実世界の経済活動に直結させようとする試みとして位置づけられる。従来のベンチマークが学術的なタスクや人工的な問題に焦点を当ててきたのに対し、GDPvalは米国労働統計局のデータに基づき、実際の職務を反映したタスクでモデルを評価する点が新しい。これは、AIの経済的影響を測定するための標準化された指標を提供する試みであり、今後のAI開発の方向性に影響を与える可能性がある。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及はできないが、AI評価の分野では、これまでも様々なベンチマークが提案されてきた。GDPvalはその中でも特に経済的価値に焦点を当てており、AIの実用性を測る新たな基準となる可能性がある。 業界構造への含意としては、GDPvalが広く採用されれば、AIモデルの開発競争が経済的価値の高いタスクに集中する可能性がある。また、企業がAI導入を検討する際の判断材料としても機能し得る。特に、人間の監督と組み合わせることでコスト削減や効率化が期待できるという分析は、企業のAI活用戦略に影響を与えるだろう。 未確定の論点としては、GDPvalのタスクが実際の職務をどの程度正確に反映しているか、また、モデルの性能向上が実際の経済生産性向上にどの程度寄与するかが挙げられる。さらに、公開された220タスクのサブセットが全体の代表性を持つかどうかも検証が必要である。今後の研究では、GDPvalのスコアと実際の経済指標との相関が確認されることが期待される。
なぜ重要か
GDPvalは、AIモデルの性能を経済的価値に基づいて評価する新たな枠組みを提供する。これにより、AI開発の目標が実世界の経済活動に即したものへとシフトし、企業や政策立案者にとってAIの潜在的な影響を測る指標となる。また、オープンソース化と公開採点サービスにより、研究コミュニティ全体での利用が促進され、AI評価の標準化が進む可能性がある。