Qingyao Wu
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RecastVLA: 適応的ポリシー状態による過去の相互作用から未来の制御へVLA2026/9/26
フローマッチング型VLAポリシー内に適応的ポリシー状態を保持し、テスト時訓練で過去の行動生成履歴を次の制御に活かす手法を提案。LIBEROやRoboTwin、実機タスクで成功率を向上させた。
- SCULPT-VLA: 段階的行動グラウンディングによる構造化制御の学習VLA2026/9/20
VLAポリシーにおいて、タスク進行・シーン動態・空間グラウンディングの要素を段階的に学習させ、教師なしで連続制御を洗練する手法を提案。LIBEROや実機タスクで成功率を向上させた。
- LIFD: ロボットマニピュレーションのための3D認識シーン記憶を実現するアンカード拡散モデルマニピュレーション2026/9/17
単一RGB視点とリカレントメモリから3D認識のシーントークンを拡散モデルで補完し、マニピュレーションポリシーに接続するシーン記憶フレームワークを提案。LIBEROやMetaWorld、実機UR5eで高い成功率を達成した。
- Roomer: 反射的オブジェクト接地モデル編集と修復による3D室内レイアウト合成3Dレイアウト生成2026/8/1
既存の室内レイアウト生成器が残す局所的な違反(衝突、はみ出し、開口部の妨害、動線の遮断)を、オブジェクト単位の修復問題として捉え、視覚言語モデルによる計画と決定的検証を組み合わせて局所編集する修復フレームワークを提案した。
- HarmoHOI: 多視点手と物体のインタラクション合成における外観と3Dモーションの調和拡散モデル/手と物体のインタラクション/多視点生成2026/7/19
手と物体のインタラクション動画を多視点で生成する際に、3D点トラッキングを疑似動画として扱うことで外観と3Dモーションを同時に生成する統一拡散フレームワークを提案した。
- RoboRouter:ロボットマニピュレーションのための訓練不要なポリシールーティングマニピュレーション2026/3/1
複数の既存ロボット操作ポリシーをプールし、タスクごとに最適なポリシーを経験から学習して選択する訓練不要のルーティング手法を提案。シミュレーションと実世界で成功率を向上させた。
- AntiGrounding:ロボット行動をVLM表現空間に持ち上げて意思決定を行うVLA2025/6/1
ロボットの行動候補をVLMの表現空間に直接持ち上げ、複数視点の軌道を描画してVQAで指示に基づく意思決定を行うことで、ゼロショットで最適な閉ループ軌道を生成するフレームワークを提案。
- FrankenBot: 視覚言語モデルを用いた脳形態モジュール型ロボットマニピュレーションマニピュレーション2025/6/1
視覚言語モデルを活用し、人間の脳の構造を模倣したモジュール型フレームワークで、ロボットマニピュレーションのタスク計画から異常処理までを統合し、効率と汎用性を両立させた。
- T-Rex: 視覚言語モデルを用いたロボット操作のためのタスク適応型空間表現抽出VLA2025/6/1
視覚言語モデルをロボット操作に応用する際、タスクの要求に応じて物体ごとに最適な空間表現抽出手法を動的に選択するフレームワークを提案し、実環境実験で空間理解・効率・安定性の向上を示した。