Cordelia Schmid
Google Research
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VLMベース視覚言語ナビゲーションモデルは何に依存しているのか:方策行動の解釈と操作VLA2026/9/21
VLMベースの視覚言語ナビゲーションモデルが視覚・指示・記憶をどう統合し、内部表現を操作することで未知環境での性能を向上できるかを解明した研究。
- 幾何学的潜在拡散による空間認識ワールドアクションモデルVLA2026/9/2
事前学習済みビデオ拡散モデルをRGBと深度の同時予測に拡張し、3D情報を活用したロボットポリシー学習を実現する空間認識ワールドアクションモデル(SA-WAM)を提案した。
- Minerva-Ego: 自己中心映像理解のための時空間ヒント映像理解2026/5/14
自己中心視点の映像理解における複雑な推論を評価するベンチマークを新たに構築し、最先端モデルが人間に及ばないことを示すとともに、時空間ヒントを与えることで性能が向上することを明らかにした。
- PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデルVLA2026/5/1
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
- HO-Flow: 潜在フローマッチングによる汎用的な手と物体のインタラクション生成手と物体のインタラクション生成2026/4/1
テキストと3D物体から手と物体のインタラクション動作を生成するフレームワークを提案。相互作用を考慮したVAEとマスク付きフローマッチングで時間的一貫性と物理的妥当性を向上させた。
- FOM-Nav: フロンティア物体マップによる物体目標ナビゲーション物体目標ナビゲーション2025/12/1
未知環境で目標物体を効率的に探索するため、空間フロンティアと物体情報を統合した地図と視覚言語モデルを組み合わせたナビゲーション手法を提案し、実機でも有効性を示した。
- 視覚言語ロボット操作のための環境横断的な失敗推論データのスケーリングVLA2025/12/1
成功軌道を摂動させて多様な失敗データを自動生成し、VLMで推論トレースを付与した大規模データセットFailCoTを構築。これで訓練した検証モデルGuardianは未知環境での失敗検出性能を向上させ、操作タスクの成功率を高めた。
- MetricNet: 生成ナビゲーションポリシーにおけるメートルスケールの復元ナビゲーション2025/9/1
生成ナビゲーションポリシーが出力する抽象的な軌跡にメートル距離を与え、障害物を回避しつつ目標へ向かう制御を可能にする手法を提案。
- Gondola: 汎用ロボット操作のための接地視覚言語プランニングVLA2025/6/1
多視点画像と履歴プランから、対象物と位置のセグメンテーションマスクを伴う次行動プランを生成するLLMベースのモデルを提案し、GemBenchで汎化性能を向上させた。
- 神経オブジェクト事前分布を用いたオンライン3Dシーン再構成3D再構成2025/3/1
RGB-D動画から物体単位でシーンをオンライン再構成するため、特徴グリッド補間と事前構築した物体ライブラリの形状事前分布を活用する手法を提案した。
- FlowNav: フローマッチングと深度事前分布を組み合わせた効率的なナビゲーションナビゲーション2024/11/1
フローマッチングと既存の基盤モデルから得られる深度事前分布を組み合わせて、ロボットナビゲーションの行動方策を学習する手法を提案し、従来法より高精度・高速なナビゲーションを実現した。
- 汎化可能な視覚言語ロボットマニピュレーションに向けて:ベンチマークとLLM誘導3Dポリシーマニピュレーション2024/10/1
視覚言語ロボット操作の汎化性能を評価する新ベンチマークGemBenchを提案し、3D情報とLLM・VLMを組み合わせた3D-LOTUS++で新規タスクの最先端性能を達成した。
- ViViDex: 人間の動画から視覚ベースの巧みなマニピュレーションを学習マニピュレーション2024/4/1
人間の動画から強化学習で物理的に妥当な軌道を生成し、それを用いて特権情報なしの統一的な視覚ポリシーを学習するフレームワークViViDexを提案。
- PolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation2023/9/1
- Object Goal Navigation with Recursive Implicit Maps2023/8/1
- Robust Visual Sim-to-Real Transfer for Robotic Manipulation2023/7/1
- Learning Video-Conditioned Policies for Unseen Manipulation Tasks2023/5/1
- Contact Models in Robotics: a Comparative Analysis2023/4/1
- Learning Reward Functions for Robotic Manipulation by Observing Humans2022/11/1
- Enforcing the consensus between Trajectory Optimization and Policy Learning for precise robot control2022/9/1
- Instruction-driven history-aware policies for robotic manipulations2022/9/1
- Augmenting differentiable physics with randomized smoothing2022/6/1
- Assembly Planning from Observations under Physical Constraints2022/4/1
- Leveraging Randomized Smoothing for Optimal Control of Nonsmooth Dynamical Systems2022/3/1
- Goal-Conditioned Reinforcement Learning with Imagined Subgoals2021/7/1
- TNT: Target-driveN Trajectory Prediction2020/8/1
- Learning Obstacle Representations for Neural Motion Planning2020/8/1
- Learning visual policies for building 3D shape categories2020/4/1