日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
サーベイarXiv:2608.18184

基盤モデル時代における人間中心知能:サーベイ

Human-Centric Intelligence in the Era of Foundation Models: A Survey

シェア:XThreadsFacebookLINEはてブBluesky

基盤モデル時代の人間中心知能について、人間を観察対象・動的アクター・状況エージェントとして捉える6層のタクソノミーを導入し、方法論、代表的手法、データセット、課題を体系的にレビューしたサーベイ論文。

詳しい要約

1. どんなもの?

本論文は、Foundation Models 時代における人間中心知能(Human-centric Intelligence)に関する包括的なサーベイである。人間を観察可能な対象(視覚的外観、空間幾何)、動的アクター(運動力学、相互作用)、状況に埋め込まれたエージェント(世界シミュレーション、身体化されたエージェンシー)として捉える6つの相互接続されたレベルからなる全スペクトラムの人間コンテキスト分類法を提案する。さらに、データファミリー、計算アーキテクチャパラダイム、トレーニング・推論最適化戦略といった方法論的基盤を整理し、各レベルでの代表的手法、データセット、ベンチマーク、評価指標を体系的にレビューする。

2. 先行研究と比べてどこがすごい?

既存のサーベイがタスクやモダリティ、研究コミュニティごとに断片的であるのに対し、本サーベイは人間中心知能をFoundation Modelsと統合する視点から、6レベルにわたる統一的な分類法を導入し、概念・方法論のつながりを明確化している点が新しい。また、スケーラビリティ、信頼性、物理的接地、展開可能性といった観点から課題と方向性を示し、継続的に更新されるリソースを提供する点も貢献である。

3. 技術・手法の肝は?

手法の肝は、人間を3つの視点(観察可能な対象、動的アクター、状況エージェント)から捉え、それぞれを2つのレベルに細分化した6レベル分類法にある。具体的には、視覚的外観、空間幾何、運動力学、相互作用、世界シミュレーション、身体化エージェンシーである。さらに、データ、アーキテクチャ、最適化戦略の方法論的基盤を整理し、各レベルでの代表的手法を体系的にレビューする枠組みを提供している。

4. どうやって有効だと検証した?

要旨からは、提案する分類法やレビューの有効性を定量的に検証したことは不明である。ただし、関連するデータセット、ベンチマーク、評価指標を整理し、プロジェクトページで文献・リソースを継続的に更新することで、コミュニティへの実用的な参照を提供している。

5. 議論はある?

議論としては、人間中心知能のスケーラビリティ、信頼性、物理的接地、展開可能性に関するオープンチャレンジと有望な研究方向が挙げられている。また、現在の進展がタスク・モダリティ・コミュニティ間で断片的であり、Foundation Modelsとの統合が未完全であるという問題意識が示されている。

6. 次に読むべき論文は?

要旨で参照されている具体的な論文は不明であるが、関連分野として、Foundation Models、Human-centric AI、身体化エージェント、世界モデル、マルチモーダル学習に関するサーベイや代表的な研究が挙げられる。具体的には、大規模言語モデル、視覚言語モデル、人間のポーズ推定・動作生成、シミュレーション環境でのエージェント学習などの論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

分類: cs.CV

原文アブストラクト

Human-centric intelligence is evolving in the foundation-model era, with growing emphasis on scale, transferability, and general-purpose modeling. Yet it has not fully integrated with foundation models to achieve the comparable progress seen in them. More importantly, recent advances across this broad landscape remain fragmented across tasks, modalities, and research communities, leaving their intrinsic conceptual and methodological connections unclear. To bridge these divides and rethink human-centric intelligence in the foundation-model era, we introduce a full-spectrum human context taxonomy that integrates six interconnected levels by viewing humans as observable subjects through visual appearance and spatial geometry, as dynamic actors through kinematic dynamics and interaction modeling, and as situated agents through world simulation and embodied agency. We next present the methodological foundations of the field, covering human-centric data families, computational architecture paradigms, and representative training and inference optimization strategies. We then systematically review representative methods across these levels and organize the associated datasets, benchmarks, and evaluation metrics. We further discuss open challenges and promising research directions toward human-centric intelligence that is scalable, trustworthy, physically grounded, and deployable, aiming to provide a coherent framework and practical reference for advancing the field. Finally, we provide a systematically organized and continuously updated collection of human-centric AI literature and resources on our project page.

関連論文