Yoichi Sato
The University of Tokyo
収録論文 3本 ・ フィジカルAI/ロボット学習
VLAデータ選択/器用操作/VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- YUBI-STAG: 自動動画言語グラウンディングによるVLAのための接触・意味豊富なアラインメントVLA2026/10/7
ロボット実演に接触物体や把持動作などの詳細な意味情報を自動付与し、視覚言語行動モデルをきめ細かい言語指示と整合させるフレームワークを提案。
- SiMDex: 類似する自己中心視点動画のマイニングによるクロスエンボディ器用操作データ選択/器用操作/VLA2026/8/1
ロボットの器用操作のためのVLAモデル訓練に有効な人間の自己中心視点動画を、類似性に基づくデータマイニングで選別するフレームワークを提案。約3200万サンプルから1.49百万件を選び、成功率を47.7%から61.1%に向上させた。
- 自己中心視点のビデオ言語モデルは手と物体の両方の手がかりを捉えているか?VLA2026/7/9
手と物体の相互作用認識において、既存のビデオ言語モデルが手や物体の見た目や動きではなく環境の相関に頼る問題を指摘し、手と物体のマスク学習と動的デコーダを導入して両方の手がかりを活用する手法を提案した。