Yuming Li
収録論文 7本 ・ フィジカルAI/ロボット学習
ビデオ生成/推論世界モデルVLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 多段階視覚推論のための階層的デノイジングビデオ生成/推論2026/7/16
因果的ビデオ生成に階層的潜在変数を統合し、粗い推論から細かい推論へと段階的に進めることで、複雑な多段階視覚推論タスクを効率的に解決するフレームワークを提案した。
- エコー・メモリ:行動世界モデルにおける記憶の制御研究世界モデル2026/6/8
行動条件付き世界モデルにおける記憶機構を制御された条件下で比較し、記憶の容量・圧縮・読み出し・再帰の各軸が性能に与える影響を明らかにした研究。
- QVLA: 視覚-言語-行動モデルの量子化におけるチャネルごとの重要度割り当てVLA2026/2/1
VLAモデルの量子化を行動空間の感度に基づいてチャネル単位でビット幅を割り当てる手法を提案し、メモリ削減とタスク成功率の両立を実現した。
- CLARE: 自律的アダプタルーティングと拡張による視覚-言語-行動モデルの継続学習VLA2026/1/1
VLAモデルに軽量アダプタを追加し、層ごとの特徴類似度に基づいて必要な箇所だけを自律的に拡張することで、過去データやタスクIDなしに破滅的忘却を防ぎながら新タスクを継続学習するフレームワークを提案。
- WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成VLA2025/10/1
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
- ManipDreamer3D:占有マップを考慮した3D軌道によるロボットマニピュレーション動画の生成マニピュレーション2025/9/1
入力画像から3D占有マップを再構成し、衝突を避けた3Dエンドエフェクタ軌道を計画して、その軌道を条件に拡散モデルでロボットのピックアンドプレース動画を生成する手法を提案した。
- ManipDreamer: 行動木と視覚ガイダンスによるロボットマニピュレーション世界モデルの強化マニピュレーション2025/4/1
指示を行動木として表現し、深度と意味の視覚ガイダンスを組み合わせることで、ロボット操作の動画生成における指示追従性と視覚品質を向上させた世界モデルを提案。