Leonidas Guibas
収録論文 42本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 幾何認識モーション潜在表現によるロバストな操作ポリシーの学習マニピュレーション2026/7/1
操作中の点群の時間変化を予測することで、外観ではなく物理的な動きを符号化する離散モーション潜在コードを学習し、単視点RGB-D入力で最先端の操作性能を達成した論文。
- デュエット:効率的な教示による二台ロボットの協調理解群制御2026/6/1
二台のロボットが協調して作業するための学習フレームワークを提案。VR遠隔操作と人間同士の協調動作データを活用し、少ない実機データで高性能な協調ポリシーを学習する。
- Fishbone: 1つの3Dアセットから100万通りの制御可能な編集へ3Dアセット生成2026/5/24
3Dメッシュの形状変形を制御するための統一的なリブ・スパイン表現を提案し、リアルタイムで予測可能な変形やアニメーションを可能にする。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- ESI-Bench:知覚と行動のループを閉じる身体化空間知能のベンチマーク身体化空間知能2026/5/1
受動的な観察ではなく、能動的な探索を通じて空間理解を行う身体化空間知能のベンチマークを提案し、能動的探索が受動的観察より優れていることを示した。
- DOT-Sim: 精密な実機-シミュレーション物理較正を備えた微分可能な光学触覚シミュレーション触覚シミュレーション2026/4/1
光学触覚センサの物理的・視覚的リアリズムを高精度に再現するため、Material Point Methodを用いた弾性体モデルと実機のアイドル状態に対する残差画像学習を組み合わせた微分可能なシミュレータを提案し、少数のデモで高速較正を実現した。
- SceneTeract: 3Dシーンにおけるエージェント機能アフォーダンスとVLMの接地3Dシーン理解2026/3/31
3Dシーンの機能性をエージェントの制約下で検証するフレームワークを提案し、複雑な活動を原子アクションに分解して幾何学的シミュレーションで検証する。また、VLMの機能推論能力の評価と、報酬エンジンとしての活用も行う。
- PhysMem: 身体性物理推論のためのテスト時メモリのスケーリングVLA2026/2/1
VLMロボットプランナがテスト時に経験から物理法則を学び、仮説を検証してから適用するメモリフレームワークを提案。実世界の操作タスクで成功率が大幅に向上。
- 試行錯誤からの学習:身体性LLMのための内省的テスト時計画VLA2026/2/1
実行前の内省で行動候補を生成・評価し、実行後の内省でモデルと方針を更新する内省的テスト時計画を提案し、長期的な家庭内タスクやロボット実験で性能向上を実証した。
- 物理世界モデルからのロボット学習マニピュレーション2025/11/1
動画生成モデルと物理世界再構成を組み合わせ、実機データなしでゼロショットのロボットマニピュレーションを実現するフレームワークPhysWorldを提案。
- あらゆる画像からのロボット学習sim2real2025/9/1
1枚の画像から物理シミュレーション可能なロボット環境を生成し、大規模な視覚運動デモンストレーションデータを自動収集するフレームワークRoLAを提案。
- ロドリゲスネットワーク:ロボット動作学習のためのキネマティクス誘導バイアス模倣学習2025/6/1
関節系の運動学構造を反映した帰納バイアスを持つニューラル演算子「Neural Rodrigues Operator」を提案し、それを用いた動作処理特化型ネットワークRodriNetを構築。模倣学習や単眼3Dハンド再構成で有効性を示した。
- ニューラルアテンションフィールド:3Dシーンにおける点間関連性の創発とワンショット巧み把持マニピュレーション2024/10/1
3D空間の任意のクエリ点とシーン点群のクロスアテンションを計算するトランスフォーマーデコーダを自己教師あり学習し、ワンショット実演から新しいシーンで巧みな把持を実現する手法を提案。
- ARCH: 長期的な接触を伴うロボット組立のための階層型ハイブリッド学習マニピュレーション2024/9/1
パラメータ化されたスキルの低レベルライブラリと模倣学習で訓練した高レベル方策を組み合わせ、接触の多い長期的な組立作業を高精度かつデータ効率的に実現する階層型手法を提案。
- D3RoMa: 素材に依存しないロボットマニピュレーションのための視差拡散ベース深度センシング深度推定2024/9/1
ステレオ画像から拡散モデルで視差マップを予測し、透明・鏡面物体でも高精度な深度推定を実現してロボット操作を改善する手法を提案。
- PhysPart: 操作可能物体の物理的に妥当な部品補完3D生成2024/8/1
操作可能な物体の欠けた部品を、形状だけでなく物理的な安定性と可動性を考慮して拡散モデルで生成する手法を提案。
- RAM: 検索ベースのアフォーダンス転移による汎用ゼロショットロボットマニピュレーションマニピュレーション2024/7/1
ロボット・人間・カスタムデータからアフォーダンス記憶を構築し、言語指示に応じて類似デモを検索して2Dアフォーダンスを3D実行可能な形に転移することで、未知の物体・環境・身体でもゼロショットで操作を実現するフレームワーク。
- 未知の関節物体のデジタルツイン構築のためのニューラル陰的表現3D再構成2024/4/1
異なる関節状態の2つのRGBDスキャンから、未知の関節物体の形状と関節モデルを再構成し、デジタルツインを構築する手法を提案。
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects2023/12/1
- Make a Donut: Hierarchical EMD-Space Planning for Zero-Shot Deformable Manipulation with Tools2023/11/1
- AO-Grasp: Articulated Object Grasp Generation2023/10/1
- SparseDFF: Sparse-View Feature Distillation for One-Shot Dexterous Manipulation2023/10/1
- EquivAct: SIM(3)-Equivariant Visuomotor Policies beyond Rigid Object Manipulation2023/10/1
- GINA-3D: Learning to Generate Implicit Neural Assets in the Wild2023/4/1
- AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-shot Interactions2021/12/1
- IFR-Explore: Learning Inter-object Functional Relationships in 3D Indoor Scenes2021/12/1
- O2O-Afford: Annotation-Free Large-Scale Object-Object Affordance Learning2021/6/1
- VAT-Mart: Learning Visual Action Trajectory Proposals for Manipulating 3D ARTiculated Objects2021/6/1
- Where2Act: From Pixels to Actions for Articulated 3D Objects2021/1/1
- Quantum Permutation Synchronization2021/1/1
- Synchronizing Probability Measures on Rotations via Optimal Transport2020/4/1
- 6D Camera Relocalization in Ambiguous Scenes via Continuous Multimodal Inference2020/4/1
- Learning 3D Part Assembly from a Single Image2020/3/1
- From Planes to Corners: Multi-Purpose Primitive Detection in Unorganized 3D Point Clouds2020/1/1
- Category-Level Articulated Object Pose Estimation2019/12/1
- Learning to Navigate Using Mid-Level Visual Priors2019/12/1
- Quaternion Equivariant Capsule Networks for 3D Point Clouds2019/12/1
- Side-Tuning: A Baseline for Network Adaptation via Additive Side Networks2019/12/1
- Mid-Level Visual Representations Improve Generalization and Sample Efficiency for Learning Visuomotor Policies2018/12/1
- Taskonomy: Disentangling Task Transfer Learning2018/4/1
- ShapeNet: An Information-Rich 3D Model Repository2015/12/1