日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
行動予測arXiv:2608.14243

ゼロショット骨格ベース行動予測

Zero-Shot Skeleton-Based Action Anticipation

シェア:XThreadsFacebookLINEはてブBluesky

未観測の行動クラスを初期段階の骨格シーケンスのみから認識するゼロショット骨格ベース行動予測(ZS-SkAA)タスクを新たに定義し、相互情報量推定・最大化によるベースラインモデルとNTU RGB+Dデータセットを用いた評価プロトコルを提案した。

詳しい要約

1. どんなもの?

本論文は、ロボットやシステムが部分的な観測から未見の行動クラスを予測する新しいタスク、Zero-Shot Skeleton-Based Action Anticipation (ZS-SkAA) を提案している。従来のskeleton-based action anticipationは訓練時に見たクラスのみを扱うが、実世界では新規行動が発生するため、ZS-SkAAは部分的なskeleton系列から未見クラスを認識することを目指す。ベースラインモデルとして、spatio-temporal feature extractorとmutual information estimation and maximizationモジュールを導入し、部分的な視覚特徴と意味的クラス埋め込みを相互情報量の推定・最大化により整列させる。また、NTU RGB+Dデータセットを用いたベンチマークプロトコルを提供し、実験で高いzero-shot精度を示す。

2. 先行研究と比べてどこがすごい?

先行研究のskeleton-based action anticipationは、訓練時に全行動クラスが既知であると仮定しており、新規クラスへの一般化ができない。一方、本提案はzero-shot learningの枠組みを導入し、未見クラスを扱える点が新しい。また、部分観測と時間ダイナミクス、zero-shot一般化の複合課題に対処するため、相互情報量に基づく特徴-意味整列を採用している点が独自性である。

3. 技術・手法の肝は?

手法の核は、ベースラインモデルがspatio-temporal feature extractorでskeleton系列から特徴を抽出し、mutual information estimation and maximizationモジュールにより、部分的な視覚特徴と意味的クラス埋め込み(例えば、クラス名のテキスト埋め込み)との間の相互情報量を推定・最大化することで、モダリティ間の整列を図る点にある。これにより、未見クラスへの一般化を促進する。

4. どうやって有効だと検証した?

NTU RGB+Dデータセットを用いて、ZS-SkAAのベンチマークプロトコルを構築し、提案モデルを評価した。実験の結果、高いzero-shot精度を達成し、ZS-SkAAの強力なベースラインとして有効であることを示した。具体的な数値や比較対象は要旨からは不明。

5. 議論はある?

要旨からは、提案手法の限界や課題についての議論は不明。ただし、ZS-SkAAは新規タスクであり、ベースラインの確立が主眼であるため、今後の改善余地や他の手法との比較などが議論される可能性がある。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する分野として、Zero-Shot Learning、Skeleton-Based Action Recognition、Action Anticipationの既存研究が挙げられる。具体的には、NTU RGB+Dデータセットを用いた行動認識や予測の論文、および相互情報量を用いた表現学習の論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Hongsong Wang, Pengbo Yan, Yang Zhang, Qiuxia Lai

分類: cs.CV

原文アブストラクト

Action anticipation (AA) aims to recognize ongoing human or humanoids actions from partial observations, enabling robots to predict intentions before the actions are completed. Although skeleton-based AA offers efficiency advantages, existing approaches assume that all action classes are seen during training, which limits their deployment in real-world scenarios where novel actions inevitably arise. To address this gap, we study the new task of Zero-Shot Skeleton-Based Action Anticipation (ZS-SkAA). This task requires recognizing unseen action classes using only limited early-stage skeleton sequences, combining the challenges of partial observations, temporal dynamics, and zero-shot generalization. To establish foundational research for ZS-SkAA, we introduce:(1) A baseline model comprising a spatio-temporal feature extractor and a mutual information estimation and maximization module. This baseline model explicitly aligns partial visual features with semantic class embeddings across modalities by estimating and maximizing their mutual information, enhancing generalization to unseen classes.(2) A benchmark protocol using the NTU RGB+D dataset, which is adapted for rigorous ZS-SkAA evaluation. Experiments demonstrate the effectiveness of our model as a strong baseline for ZS-SkAA, achieving high zero-shot accuracy on NTU RGB+D. This work establishes ZS-SkAA as a vital research direction for real-world systems requiring generalization to novel actions.

関連論文