日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
H2R受け渡し/ビデオ生成arXiv:2608.13028v2

人間からロボットへの物体受け渡し予測を改善するRGB-Dビデオ生成

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

シェア:XThreadsFacebookLINEはてブBluesky

物体受け渡し時のRGB-Dビデオデータセットと生成パイプラインを提案し、実ロボットでのゼロショット転移と早期意図予測を実現した。

詳しい要約

1. どんなもの?

本論文は、人間からロボットへの物体受け渡し(H2R object handover)の予測性能を向上させるために、RGB-Dビデオ生成フレームワークを提案する。具体的には、手渡しシーンに特化したRGB-Dビデオデータセット「Hand2Bot」と、ビデオ拡散モデルを用いた生成パイプライン「PassGen」を導入する。PassGenは、意図認識型の時間的顔エンコーダを用いて、手と物体の一貫性を保ちながら現実的な手渡しシーケンスを合成する。さらに、物理的な深度マップのノイズを模倣する形態ベースの深度編集戦略により、シミュレーションと実環境のギャップ(sim-to-real gap)を低減する。

2. 先行研究と比べてどこがすごい?

従来の研究は、手の動きや物体の位置に焦点を当てた手中心(hand-centric)のアプローチが多く、人間の身体姿勢や表情などの文脈情報を十分に活用していなかった。また、大規模な人間中心のデータセットが不足しており、シミュレーションと実環境の差が課題であった。本手法は、RGB-Dビデオデータセットを新たに構築し、顔の表情から意図を推定するエンコーダを導入することで、従来の手中心の手法よりも早い段階で意図を予測できる点が優れている。さらに、深度ノイズを模倣することで、実環境への転移を容易にしている。

3. 技術・手法の肝は?

手法の核は、PassGenと呼ばれる生成パイプラインである。これは、安定したビデオ拡散モデル(stable video diffusion)を利用し、Intention-Aware Temporal Face Encoderを組み込むことで、手渡しの意図を反映した顔の表情変化を時間的に捉え、現実的な手渡しシーケンスを生成する。また、手と物体の一貫性を保つための工夫がなされている。さらに、sim-to-realギャップを埋めるために、形態ベースの深度編集戦略(morphology-based depth editing)を採用し、実際の深度センサで観測されるノイズパターンを合成データに付加する。

4. どうやって有効だと検証した?

提案フレームワークの有効性は、アブレーション研究と実ロボットプラットフォームでの実世界展開の両方で検証された。評価指標として、意図識別精度(intention identification accuracy)と誤トリガー率(false trigger rate)を用い、高い意図識別精度と低い誤トリガー率を達成した。また、PassGenで訓練したモデルは、従来の手中心のベースラインと比較して、ゼロショット転移が可能であり、より早い段階で意図を予測できることが確認された。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、提案手法が社会的に配慮したロボット行動を可能にすると述べている。一方で、生成されたビデオの品質や多様性、実環境でのノイズモデルの限界などが潜在的な課題として考えられるが、要旨では明示されていない。また、データセットの規模や多様性に関する議論も要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、ビデオ拡散モデル(video diffusion models)や、人間とロボットのインタラクションにおける意図予測に関する研究が挙げられる。また、sim-to-real転移のための深度ノイズモデリングに関する研究も関連する。具体的な論文名は要旨に記載がないため、同分野の定番として、人間の動作予測や物体受け渡しに関する研究(例:Human Motion Prediction, Object Handover in HRI)を次に読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

分類: cs.CV, cs.RO

原文アブストラクト

Human-to-robot (H2R) object handover is a fundamental capability for human-robot collaboration, yet progress is hindered by the scarcity of large-scale, human-centric datasets and the significant sim-to-real gap. To address these challenges, we introduce Hand2Bot, an RGB-D video dataset that provides rich contextual information such as body posture and facial expressions, specifically collected for handover scenarios with real-world noise patterns. We further propose PassGen, a generative pipeline that leverages stable video diffusion and an Intention-Aware Temporal Face Encoder to synthesize realistic handover sequences while ensuring hand-object consistency. To bridge the sim-to-real gap, we implement a morphology-based depth editing strategy that replicates realistic sensor noise found in physical depth maps. Experimental evaluations demonstrate that our framework achieves high intention identification accuracy and low false trigger rates in both ablation studies and real-world deployment on a physical robot platform. Our results confirm that training on PassGen allows for robust zero-shot transfer and earlier intention anticipation compared to traditional hand-centric baselines, effectively enabling socially aware robotic behavior in shared workspaces.