Risa Shinoda
収録論文 1本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 自己中心視点のビデオ言語モデルは手と物体の両方の手がかりを捉えているか?VLA2026/7/9
手と物体の相互作用認識において、既存のビデオ言語モデルが手や物体の見た目や動きではなく環境の相関に頼る問題を指摘し、手と物体のマスク学習と動的デコーダを導入して両方の手がかりを活用する手法を提案した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
手と物体の相互作用認識において、既存のビデオ言語モデルが手や物体の見た目や動きではなく環境の相関に頼る問題を指摘し、手と物体のマスク学習と動的デコーダを導入して両方の手がかりを活用する手法を提案した。