Liudi Yang
収録論文 6本 ・ フィジカルAI/ロボット学習
ビデオ生成VLA動画生成ソフトロボティクスSLAM3Dマッピング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VideoWeaver: 身体化エージェントのためのマルチモーダル・マルチビュー動画間変換ビデオ生成2026/3/26
複数カメラの視点を共有4D潜在空間で整合させ、拡散モデルを用いて視点一貫性のある動画変換を実現する初のマルチビューV2Vフレームワークを提案した。
- ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデルVLA2026/3/1
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。
- DRAW2ACT:深度エンコード軌道からロボット実演動画を生成動画生成2025/12/1
入力軌道から深度・意味・形状・動きの表現を抽出し、RGBと深度の動画を同時生成する拡散モデルを提案。生成動画から関節角度を回帰する方策も導入し、操作成功率を向上させた。
- 流れマッチングによる軽量な駆動空間学習で全身ソフトロボット把持を実現ソフトロボティクス2025/11/1
流れマッチング(Rectified Flow)を用いて、30回の実演のみから全身ソフトロボットの把持制御を学習し、97.5%の成功率と広い汎化性能を達成した。
- グラフ注意ネットワークを用いた意味グラフによるLiDARループ閉じ込み検出SLAM2025/1/1
LiDAR点群の意味グラフをグラフ注意ネットワークで符号化し、場所認識と意味的レジストレーションにより6自由度相対姿勢制約を推定するループ閉じ込み検出法を提案。
- ハンドヘルド・ロボット搭載LiDARマッピングのための生涯3Dマッピングフレームワーク3Dマッピング2025/1/1
ハンドヘルドとロボット搭載の両方に対応し、動的点除去・マルチセッション位置合わせ・地図変化検出・地図バージョン管理を統合した生涯3Dマッピングフレームワークを提案。