Zhiying Du
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Finder: 身体性グラウンディングのためのエージェント型閉ループ物体探索VLA2026/9/16
言語で指定された物体を部分的に観測された3Dシーンから見つけるため、計画・証拠収集・検証・制御を閉ループで回すエージェント型手法を提案し、物体検索や質問応答で精度を向上させた。
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- FM-VLA: 接触を伴う操作における視覚言語行動モデルのための力覚ベースメモリVLA/操作2026/7/1
視覚言語行動モデルに力覚履歴をメモリとして組み込み、非マルコフ的で接触を伴う操作タスクの時間的文脈推論を可能にした。
- SegDiff: セグメント化軌道拡散による一貫性と適応性を備えたロボット操作マニピュレーション2026/7/1
模倣学習において、連続予測とキーポーズ予測の利点を統合し、キーポーズ間の軌道を拡散モデルで予測する閉ループ視覚運動ポリシーを提案。動的環境への適応性と制御安定性を向上させた。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- TaskGround: 全シーン家庭内推論のための構造化実行可能タスク推論タスク推論2026/5/1
家庭内エージェントが完全なシーンと状況依頼から実行可能なタスク構造を推論するための、訓練不要でモデル非依存のフレームワークを提案し、新評価スイートFullHomeで効果を実証した。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- VideoVLA:動画生成モデルを汎用ロボットマニピュレータに転換VLA2025/12/1
大規模動画生成モデルをロボットの視覚-言語-行動モデルに転換し、言語指示と画像から行動列と将来の視覚結果を同時予測することで、新規物体や他機体スキルへの汎化を実現した。
- カメラ座標系でロボット動作を統一するクロスエンボディメント学習2025/11/1
カメラ外部パラメータを用いて異なるロボットの動作をカメラ座標系で統一し、訓練不要でカメラ外部パラメータを推定するCalibAllを提案。16データセットで約97Kエピソードを校正し、クロスエンボディメント事前学習で最先端性能を達成。