Fengyi Shen
収録論文 4本 ・ フィジカルAI/ロボット学習
マニピュレーションビデオ生成VLA動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VidAct: 物体中心の3D認識で野生動画からマニピュレーションを学習マニピュレーション2026/9/29
単眼の実世界動画から物体メッシュと運動を再構成し、残差軌道転移と物体中心の3D点群予測を組み合わせて、ゼロショットで実機展開可能なマニピュレーションポリシーを学習するフレームワーク。
- VideoWeaver: 身体化エージェントのためのマルチモーダル・マルチビュー動画間変換ビデオ生成2026/3/26
複数カメラの視点を共有4D潜在空間で整合させ、拡散モデルを用いて視点一貫性のある動画変換を実現する初のマルチビューV2Vフレームワークを提案した。
- ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデルVLA2026/3/1
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。
- DRAW2ACT:深度エンコード軌道からロボット実演動画を生成動画生成2025/12/1
入力軌道から深度・意味・形状・動きの表現を抽出し、RGBと深度の動画を同時生成する拡散モデルを提案。生成動画から関節角度を回帰する方策も導入し、操作成功率を向上させた。