Xudong Xu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboSnap: ワンショット実世界からシミュレーションへのシーン生成による汎用ロボット学習と評価sim2real2026/7/1
単一のRGB画像から物理的に安定し視覚的にも忠実なシミュレーション環境を自動生成するフレームワークを提案し、ロボットの軌道再現やポリシー学習・評価に活用できることを示した。
- Trans2Occ: 透明物体のボクセル占有推定と把持 - シミュレーションから実世界へマニピュレーション2026/6/1
単一RGB画像から透明物体のボクセル占有を直接予測し、シミュレーションで大規模学習したモデルを実ロボットに微調整なしで適用して把持を実現する枠組みを提案した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- ClothTransformer: 統一潜在空間トランスフォーマーによるスケーラブルな布地シミュレーションシミュレーション2026/5/27
布地シミュレーションを学習された潜在空間での自己回帰シーケンスモデリングとして再定式化し、多様なシナリオを単一モデルで扱える統一トランスフォーマーを提案。従来手法より誤差を約4〜9倍低減し、メッシュ解像度に依存しないスケーラブルな計算を実現した。
- コードとしての部屋:エージェント的コード合成による俯瞰画像からの3D部屋生成3D生成2026/5/18
俯瞰画像から3D部屋を生成するため、MLLMベースのエージェントがBlenderコードを段階的に合成するフレームワークを提案。記憶モジュールで文脈忘却を防ぎ、専用ベンチマークで有効性を検証した。
- STABLE: セマンティクスと物理の二重システムによるシミュレーション対応テーブルトップレイアウト生成シーン生成2026/5/1
タスク指示からシミュレーション可能なテーブルトップシーンを生成するため、意味推論と物理補正を交互に行う二重システムを提案した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- MesaTask: 3D空間推論によるタスク駆動型卓上シーン生成シーン生成2025/9/1
タスク指示から物理的に妥当な卓上シーンを生成するため、空間推論チェーンとDPOで強化したLLMフレームワークMesaTaskを提案し、大規模データセットMesaTask-10Kを構築した。
- InternScenes: 現実的なレイアウトを持つ大規模シミュレーション可能屋内シーンデータセットsim2real2025/9/1
実世界スキャン・手続き生成・デザイナー作成の3ソースを統合し、約4万シーン・196万物体を含む大規模でシミュレーション可能な屋内3Dシーンデータセットを構築した。