Xiaobao Wei
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GraspFoM: 3D基盤モデルを用いた再構成駆動型ロボット把持マニピュレーション2026/6/7
3D基盤モデル(SAM3D)を活用し、物体の再構成と把持姿勢予測を共有の3D潜在表現で統合するフレームワークを提案。再構成による幾何情報と把持学習の相互作用で、部分観測下でも高精度な把持と高忠実度な3D再構成を実現した。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- PhyMix: 暗黙的・明示的最適化による物理的に整合的な単一画像3D屋内シーン生成3Dシーン生成2026/4/11
単一画像から3D屋内シーンを生成する際に物理的整合性を評価する統一ベンチマークを構築し、物理評価器のフィードバックを訓練と推論に統合するフレームワークPhyMixを提案した。
- PIGEON: VLM駆動の関心点選択による物体ナビゲーション物体ナビゲーション2025/11/1
VLMを関心点(PoI)の選択に用いることで、未見屋内環境での物体ナビゲーションを効率的かつ検証可能にし、ゼロショットで最先端性能を達成した研究。
- RoboArmGS: ベジェ曲線補正による高品質なロボットアームのスプラッティングロボットアーム/3D再構成2025/11/1
URDFに基づく理想的な関節運動を学習可能なベジェ曲線で補正し、実世界の動きに即した高品質な3Dガウシアン表現を実現した研究。
- ManipDreamer3D:占有マップを考慮した3D軌道によるロボットマニピュレーション動画の生成マニピュレーション2025/9/1
入力画像から3D占有マップを再構成し、衝突を避けた3Dエンドエフェクタ軌道を計画して、その軌道を条件に拡散モデルでロボットのピックアンドプレース動画を生成する手法を提案した。
- OmniIndoor3D:包括的な屋内3D再構成3D再構成2025/5/1
RGB-Dカメラで撮影した屋内シーンを、ガウス表現を用いて見た目・形状・パノプティックに高精度で再構成するフレームワークを提案。
- ManipDreamer: 行動木と視覚ガイダンスによるロボットマニピュレーション世界モデルの強化マニピュレーション2025/4/1
指示を行動木として表現し、深度と意味の視覚ガイダンスを組み合わせることで、ロボット操作の動画生成における指示追従性と視覚品質を向上させた世界モデルを提案。
- Center-of-Mass-based Robust Grasp Pose Adaptation Using RGBD Camera and Force/Torque Sensing2022/5/1