Shuzhao Xie
Tsinghua University
収録論文 6本 ・ フィジカルAI/ロボット学習
シーン再構成/sim2realワールドモデル4D時空間推論VLAデータ生成模倣学習/視覚運動ポリシー
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CoDimRecon: 変形可能な曲線・曲面・体積を含むシミュレーション可能な3Dシーンのエージェント的再構成シーン再構成/sim2real2026/9/28
多視点RGB画像から、剛体・関節物体・変形物体を含む編集可能な3Dシーンをエージェント的に再構成し、ロッド・シェル・ソリッドの物理シミュレーションにそのまま使えるアセットを生成するフレームワーク。
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/1
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストなゼロショット汎化を実現するインタラクティブワールドモデルを提案した。
- DynTrace: 4D時空間推論のための動的物体証跡追跡4D時空間推論2026/7/14
MLLMの4D時空間推論を強化するため、トレーニング不要のフレームワークDynTraceを提案。動的軌跡可視化と動的トレーストークンで物体の動きを連続追跡し、カメラ運動と物体運動を分離する。
- RoboStream: 視覚言語モデルに時空間推論と記憶を統合したロボット操作フレームワークVLA2026/3/1
視覚言語モデルに時空間融合トークンと因果時空間グラフを導入し、長期ロボット操作における幾何学的定位と行動による状態変化の記憶を訓練なしで実現する。
- IGen: オープンワールド画像からのロボット学習のためのスケーラブルなデータ生成データ生成2025/12/1
オープンワールド画像から3Dシーン表現とVLM推論を用いてロボットの視覚運動データを生成し、実世界データに匹敵する性能のポリシー学習を可能にするフレームワークを提案。
- VGGT-DP: 視覚基盤モデルによる汎化可能なロボット制御模倣学習/視覚運動ポリシー2025/9/1
3D知覚モデルVGGTを視覚エンコーダに用い、固有感覚フィードバックと組み合わせた視覚運動ポリシーを提案。トークン再利用とランダム枝刈りで推論を高速化し、MetaWorldタスクで高精度・長期的タスクの性能を向上させた。