Muhammad Zubair Irshad
Toyota Research Institute
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- H2RBench:人間からロボットへの転移を評価するReal-to-Simベンチマークsim2real2026/9/21
人間の動画デモからロボット操作を学習するH2R転移手法を公平に比較するため、実人間動画とシミュレーションロボット実演に基づく標準ベンチマークを構築し、複数手法の性能を体系的に評価した。
- RoboDream: スケーラブルなロボットデータ合成のための構成的世界モデルデータ生成/世界モデル2026/6/1
ロボット学習のための大規模データ生成を実現する、エンボディメント中心の世界モデルを提案。実ロボットの動作をレンダリングし、シーンや物体の事前知識を条件付けすることで、物理的に実現可能なフォトリアリスティックなデモを合成し、データスケーリングを可能にする。
- ビデオからシミュレーション、そして実世界へ:単一の人間ビデオからの全自動器用スキル獲得器用操作/sim2real2026/6/1
単一の人間操作ビデオから、シミュレーション環境でのデジタルツイン構築と物体中心のキーフレーム最適化によりロボット動作を獲得し、さらに実世界のノイズや不完全な知覚への頑健性を分離するsim-to-real戦略で器用な操作スキルを自律的に獲得するフレームワークを提案した。
- 生成による再構築:スパース観測からの3D複数物体シーン再構築3D再構築2026/4/1
RGB-D画像のスパースな観測から、物体や部品の形状と姿勢を確率的に推定する生成フレームワークRecGenを提案し、複雑な遮蔽や対称物体に対応して高精度な再構築を実現した。
- AnyView: 動的シーンにおける任意の新規視点を合成動的視点合成2026/1/1
拡散モデルベースの動画生成フレームワークで、動的な実世界シーンにおいて任意のカメラ視点からの時空間的に一貫した新規動画を生成する。
- EVE: 生成的ポリシーのための生成器-検証器システムVLA2025/12/1
拡散・フローマッチングなどの生成的視覚運動ポリシーを、追加学習なしでテスト時にVLMベースの検証器群と組み合わせて性能を向上させるフレームワークEVEを提案。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- AnchorDream: 動画拡散モデルを活用した身体性を考慮したロボットデータ合成データ合成/拡散モデル2025/12/1
ロボットの動作レンダリングを条件に事前学習済み動画拡散モデルを再利用し、身体性の一貫性を保ちながら多様なロボット実演データを合成する手法を提案。
- EmbodiedSplat: モバイル端末からのガウススプラッティングによる個人化されたReal-to-Sim-to-Realナビゲーションsim2real2025/9/1
iPhoneで撮影した実環境を3Dガウススプラッティングで再構築し、Habitat-Sim上で方策を微調整することで、実世界の画像ナビゲーション性能を大幅に向上させる手法を提案。
- マルチタスク巧みな操作のための大規模行動モデルの慎重な検証マニピュレーション2025/7/1
大規模行動モデル(LBM)をシミュレーションと実世界で厳密に評価し、マルチタスク事前学習が単一タスクより成功率・堅牢性・データ効率を高めることを統計的に示した。
- SplArt: 3Dガウシアンスプラッティングによる関節物体の関節推定とパーツレベル再構成3D再構成2025/6/1
2つの関節状態で撮影したRGB画像から、3Dガウシアンスプラッティングを用いて関節物体の形状・パーツ分割・関節運動を自己教師ありで推定し、リアルタイムなフォトリアル描画を可能にする手法。
- GTR: 外観と幾何学的複雑さに基づく未知物体のガウシアンスプラッティング追跡と再構成3D再構成/物体追跡2025/5/1
単眼RGBD動画から未知物体の6自由度追跡と高品質な3D再構成を同時に行う手法を提案。3Dガウシアンスプラッティングと外観・形状のハイブリッド追跡、キーフレーム選択を組み合わせ、対称性や複雑な形状・外観を持つ物体でも頑健に動作する。
- Real2Render2Real:力学シミュレーションもロボット実機も不要なロボットデータ拡張sim2real2025/5/1
スマホで撮影した物体スキャンと人間の実演動画1本から、3Dガウススプラッティングで高精細なロボット実演データを大量生成する手法。実機テレオペ150回分に匹敵する性能を実現。
- 持続的オブジェクトガウシアンスプラット(POGS): 不規則形状物体の人間・ロボット操作追跡マニピュレーション2025/3/1
ガウシアンスプラットに意味情報と自己教師あり視覚特徴を組み込み、単眼ステレオカメラで未知の不規則形状物体の姿勢を継続的に推定するシステムを提案。把持・再配向・言語駆動操作を支援し、ツール摂動からの復帰も実現。
- ロボティクスにおけるニューラルフィールド:サーベイニューラルフィールド2024/10/1
ニューラルフィールドのロボティクス応用を200本以上の論文に基づき、4つの主要フレームワークと5つの応用領域(姿勢推定、マニピュレーション、ナビゲーション、物理、自動運転)に分類してレビューしたサーベイ論文。
- 言語埋め込みガウシアンスプラット(LEGS):移動ロボットによる部屋規模表現の漸進的構築VLA2024/9/1
移動ロボットが環境を移動しながら、見た目と言語意味を統合した3D表現(LEGS)をオンラインで構築し、オープン語彙の物体検索を可能にする手法を提案。LERFより3.5倍高速で、最大66%の精度で物体を特定できる。
- RoVi-Aug: ロボットと視点の拡張による異なる機体間のロボット学習sim2real2024/9/1
画像生成モデルでロボットの種類とカメラ視点を拡張し、未見のロボットや視点でもゼロショットで動く方策を学習する手法を提案。
- 帰納的プライアを活用した3Dロボティクス知覚の学習3D知覚2024/5/1
幾何・外観・モジュール性・意味・構造・文脈などの事前知識を深層学習モデルに組み込み、物体中心の3D再構成、視覚と言語による意思決定、3Dシーン理解というロボティクス知覚タスクを効率的に解く手法を提案した論文。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- DiffusionNOCS: Managing Symmetry and Uncertainty in Sim2Real Multi-Modal Category-level Pose Estimation2024/2/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- FSD: Fast Self-Supervised Single RGB-D to Categorical 3D Objects2023/10/1
- CARTO: Category and Joint Agnostic Reconstruction of ARTiculated Objects2023/3/1
- ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose Optimization2022/7/1
- CenterSnap: Single-Shot Multi-Object 3D Shape Reconstruction and Categorical 6D Pose and Size Estimation2022/3/1
- SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments2021/8/1
- Hierarchical Cross-Modal Agent for Robotics Vision-and-Language Navigation2021/4/1