Yamin Mao
収録論文 4本 ・ フィジカルAI/ロボット学習
VLAビデオ理解/質問応答双腕操作/VLAVLA/マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- H-VLA:キーアクション推論と運動計画を統合行動空間で行う階層型視覚-言語-行動モデルVLA2026/9/19
高レベルのキーアクション推論と低レベルの運動生成を分離し、統一されたカメラ中心行動空間でロボット操作を学習する階層型VLAフレームワークを提案。
- R4DSG:長尺一人称ビデオにおけるオブジェクト中心の質問応答のための相対4Dシーングラフメモリビデオ理解/質問応答2026/8/11
長い一人称ビデオから、物体の移動や状態変化などの質問に答えるため、安定したアンカーと動的物体を分離し、アンカー相対の変化として物体状態を記憶する新しいメモリ表現を提案した。
- Co-VLA: 双腕ビジョン・ランゲージ・アクションシステムのための協調認識型構造化アクションモデリング双腕操作/VLA2026/6/1
双腕ロボット操作において、明示的な協調構造をVLAモデルに導入し、共有・残差潜在変数と制御器により信頼性と解釈可能性を向上させるフレームワークを提案した。
- DAM-VLA: 動的行動モデルに基づくロボット操作のための視覚言語行動フレームワークVLA/マニピュレーション2026/3/1
VLMの推論と拡散ベースの行動モデルを統合し、タスクに応じて腕の移動とグリッパー操作を動的に切り替えるVLAフレームワークを提案。シミュレーションと実環境で高い成功率を達成した。