Marc Pollefeys
ETH Zurich
収録論文 78本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CLoSeR: 長文ストリーミング再構成のためのループ閉じ込み3D再構成2026/10/1
ストリーミング3D再構成基盤モデルにループ閉じ込みを導入し、SE(3)多様体上で姿勢を最適化することで、キロメートル規模の長い系列でもドリフトを抑えて高精度な再構成を実現した。
- ChronoGraph: 視覚言語モデルによる機能的な4Dシーングラフで相互作用理解と接地計画を実現VLA2026/9/30
行動によるシーンの変化を4Dシーングラフとして表現し、視覚言語モデルで理解と計画を統合する手法を提案。グラフを思考連鎖として学習させ、実世界の移動マニピュレーションにも応用した。
- 見えなくなった後も空間を推論する:視野外時空間推論のためのVLMベンチマークVLM2026/9/28
動画内で視界から消えた物体の位置や状態を推論する能力を評価する初のVQAベンチマークBeyond3Dを構築し、9種類のVLMを評価した。
- エレベーターVIGS:視覚慣性ガウススプラッティングSLAMにおけるエレベーター運動とロボット運動の分離SLAM2026/9/20
エレベーター内でカメラとIMUの観測が矛盾する問題を、ロボットの姿勢をエレベーター座標系で推定しエレベーターの運動を別状態として扱うことで解決し、走行中も追跡とマッピングを維持するSLAMシステムを提案した。
- ForceTwin: 計測された人間の操作からロボットマニピュレーションのための物理情報デジタルツインを構築マニピュレーション2026/9/18
力覚グリッパで人間が物体を操作した際の姿勢と力を用い、慣性・摩擦・機構動力学を含む物理情報デジタルツインを同定する手法を提案し、インピーダンス制御のフィードフォワードモデルとして目標達成率を大幅に改善した。
- Map-Det3D: ストリーミング入力からの多視点3D物体検出のためのメトリックフィードフォワード3D再構築事前知識3D物体検出2026/8/12
単眼ビデオから直接メトリック3D空間で物体検出を行うため、RGBから3D再構築するフィードフォワードモデルを幾何学的バックボーンとして利用し、2Dから3Dへのリフティングを回避する新しいオンライン多視点3D物体検出モデルを提案した。
- EgoTrack3D: 自己中心視点3D物体追跡のためのモジュラーフレームワーク3D追跡2026/8/8
自己中心視点のRGBビデオから動的な3Dシーン表現を再構築・維持するモジュラーフレームワークを提案し、静的・動的物体の持続的な3D追跡を実現した。
- DVPSFormer: 自動運転のための効率的なオンライン深度対応ビデオパノプティックセグメンテーションパノプティックセグメンテーション2026/7/28
自動運転向けに、深度・セマンティックセグメンテーション・インスタンス追跡を統合したオンライン4Dシーン理解アーキテクチャを提案。明示的なシーン離散化とオンライン多数決により、リアルタイム処理を実現し、ベンチマークでSOTAを達成。
- EgoHTR: 人間の地形移動の自己中心視点4Dデモンストレーション歩行2026/7/1
自己中心視点のウェアラブルと3Dスキャナを用いて、複雑な環境での人間の移動シーンを再構成するパイプラインとデータセットを構築し、これを活用して人型ロボットの移動ポリシーを訓練し実機で検証した。
- VidMap: 時間構造を活用したビデオベースのStructure-from-MotionStructure-from-Motion2026/7/1
SLAMの逐次制約とSfMの大域最適化を組み合わせ、任意の長い非校正ビデオからメートルスケールのカメラ軌道を頑健に復元するシステムを提案した。
- LIME: 一人称視点ビデオから意図を考慮したカメラモーションを学習するカメラモーション生成2026/7/1
ロボットが自然言語の指示に基づいて次に観察すべきカメラの相対姿勢を生成する手法を提案。一人称ビデオから多様な意図とカメラ動作のペアを学習し、観察利得の予測と連続的なフローマッチングによる姿勢生成を組み合わせる。
- PROSE: 視覚言語モデルによる学習不要の自己中心視点シーン位置合わせシーン位置合わせ2026/6/15
頭部装着カメラで撮影した同一室内の異なる時刻のRGB映像を、事前学習済み視覚言語モデルを用いて物体レベルの3Dシーングラフに変換し、物体対応付けと幾何的検証により位置合わせする学習不要の手法を提案した。
- SG2Loc: 3Dシーングラフを用いた逐次視覚位置推定位置推定2026/6/10
3Dシーングラフを環境表現に用いた軽量な逐次視覚位置推定手法を提案。パーティクルフィルタとセマンティック特徴マッチングにより、大規模な画像データベースや点群を必要とせずに位置推定を実現する。
- ArtiTwinSplat: RGB-Dビデオからのガウシアンスプラッティングによるインタラクティブなデジタルツイン再構築デジタルツイン/3D再構築2026/6/1
RGB-Dビデオから物体の可動部構造と関節運動を自動推定し、写真のようにリアルで操作可能なデジタルツインを構築するフレームワークを提案。CADモデルや手動アノテーションを不要とし、実世界の観測から直接ロボットの計画・学習に使えるモデルを生成する。
- Z-FLoc: 幾何プリミティブによるゼロショット間取り図位置推定位置推定2026/6/1
カメラ画像と間取り図の見た目の差を、直線や円などの幾何プリミティブで橋渡しし、再学習なしで未知環境に適用できるゼロショットの位置推定手法を提案した。
- 幾何学的行動モデルによるロボットポリシー学習VLA2026/6/1
事前学習済みの幾何基盤モデルを共有基盤として、言語条件付きの未来予測と行動生成を統合した操作ポリシーを提案。シミュレーションと実機で高精度・高速・軽量を実証。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- LocalNav: フロンティアVLMと身体化RLの蒸留によるオンデバイス物体目標ナビゲーションナビゲーション2026/6/1
大規模VLMの空間推論能力を軽量な4BパラメータのローカルVLMに蒸留し、組み込みGPU上で低遅延な物体目標ナビゲーションを実現する手法を提案した。
- 対話型ビデオ世界モデリングに向けて:フロンティア、課題、ベンチマーク、将来動向世界モデリング2026/5/31
本論文は、ユーザーのアクションを条件としたビデオや3D生成による対話型世界モデリングの研究動向、技術的課題、評価ベンチマークを体系的にレビューし、将来の研究方向を提案する。
- TriSplat: シミュレーション対応のフィードフォワード3Dシーン再構築3D再構築2026/5/25
スパース視点からの3D再構築を、三角形プリミティブを用いてフィードフォワードで行い、シミュレーションに使えるメッシュを直接出力する手法を提案した。
- 屋内空間のための階層的かつ全体的なオープンボキャブラリー機能3Dシーングラフ3Dシーン理解2026/5/1
機能的な3Dシーングラフの構築において、テーブルトップ上の密集した物体や多階層の機能関係を扱う新しいパイプラインを提案し、2D視覚グラウンディングと3Dグラフ最適化により頑健なグラフ構造を復元する。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- EgoVerse:世界各地から収集したロボット学習用の自己中心視点人間データセットデータセット/模倣学習2026/4/1
人間の自己中心視点のデモデータを大規模に収集・共有するプラットフォームとデータセットを構築し、人間データからロボットへの転移学習の大規模実験を行った。
- 地図より記憶を:再構成なしの3D物体位置推定物体位置推定2026/3/1
3Dシーン再構成を行わず、姿勢付きRGB-Dキーフレームのみを記憶して視覚言語モデルで候補を絞り、必要時に奥行き逆投影と多視点融合で対象の3D位置を推定する手法を提案。
- 実世界でのDROID-SLAM:不確実性を考慮した動的環境対応RGB SLAMSLAM2026/3/1
動的環境で頑健なリアルタイムRGB SLAMシステムを提案し、多視点の視覚特徴の不一致から画素ごとの不確実性を推定して追跡と再構築を改善した。
- OpenFrontier: 視覚言語に基づくフロンティアを用いた汎用ナビゲーションナビゲーション2026/3/1
視覚言語モデルを活用し、フロンティアを意味的アンカーとして用いることで、タスク固有の学習や微調整なしに効率的なゼロショットナビゲーションを実現するフレームワークを提案。
- RaCo: 実用的な学習ベースキーポイントのためのランキングと共分散キーポイント検出2026/2/1
透視画像クロップのみで学習し、回転に頑健なキーポイント検出器と、限られた数のキーポイントでマッチ数を最大化する微分可能ランカー、空間的不確かさを定量化する共分散推定器を統合した軽量ニューラルネットワークを提案。
- 開世界モバイルマニピュレーションのための関節3Dシーングラフモバイルマニピュレーション2026/2/1
RGB-D動画から物体の関節運動を推定し、親子関係を含む意味的・運動学的3Dシーングラフを構築するフレームワークMoMa-SGを提案。
- VIGS-SLAM: 視覚慣性ガウススプラッティングSLAMSLAM2025/12/1
視覚とIMUを統合最適化し、3Dガウススプラッティングによるリアルタイム追跡と高精細再構成を実現したSLAMシステム。
- Hoi!:力に基づくクロスビュー関節物体操作のマルチモーダルデータセットマニピュレーション2025/12/1
人間とロボットの4つの操作形態で関節物体を操作した3048シーケンスを収録し、視覚・力・触覚を統合したデータセットを構築した。
- 物体目標ナビゲーションのための強化学習手法で重要な要素は何か?実証研究と統合フレームワーク物体目標ナビゲーション2025/10/1
物体目標ナビゲーションの強化学習システムを認識・方策・テスト時強化の3要素に分解し、大規模実験で各要素の影響を分析。認識とテスト時戦略の改善が方策改善より効果的であることを示し、統合フレームワークを提案。
- REACT3D: 対話型物理3Dシーンの関節構造を復元シーン理解2025/10/1
静的な3Dシーンから可動部を検出し、関節の種類や動作を推定して、シミュレーション可能な対話型シーンへと自動変換するゼロショット手法を提案。
- 都市規模での一人称視点視覚慣性SLAMベンチマークSLAM2025/9/1
眼鏡型デバイスで都市中心部を歩行・車移動した長時間の自己中心視点データを収録し、測量器具によるセンチメートル精度の間接的な姿勢注釈を付与した視覚慣性SLAM用データセットとベンチマークを提案。既存手法が夜間歩行や車移動で頑健でないことを示す。
- MCGS-SLAM: ガウススプラッティングを用いた高忠実度マッピングのためのマルチカメラSLAMフレームワークSLAM2025/9/1
複数のRGBカメラ入力を3Dガウススプラッティングで統合し、高精度な軌跡推定とフォトリアルな再構成をリアルタイムで行うマルチカメラSLAMを提案。
- 見えれば到達不要:知覚考慮型強化学習による効率的なロボット検査ナビゲーション2025/9/1
検査対象が見えた時点で移動を止めることを目的とし、地図なしで最短の視認可能軌道を学習する強化学習フレームワークを提案。シミュレーションで訓練し実機に展開、従来手法より効率的な検査軌道を実現。
- ActLoc: 能動的視点選択による移動中の自己位置推定ナビゲーション2025/8/1
地図構築時のカメラ姿勢を学習し、任意の3D位置でのヨー・ピッチ方向の自己位置推定精度を予測する注意機構モデルを提案。これを経路計画に組み込み、タスク・運動制約下で自己位置推定が最も頑健になる視点を能動的に選ぶ枠組み。
- Spot-On: 複数ロボット協調のための複合現実インターフェース複合現実/群制御2025/5/1
複合現実(MR)を用いて複数の四足歩行ロボットを操作し、引き出しやドア、照明スイッチなどの協調作業を可能にするフレームワークを提案し、ユーザビリティを検証した。
- 動的環境における単眼ガウシアンスプラッティングSLAMSLAM2025/4/1
動く物体がある環境でも、不確かさを考慮した幾何マッピングにより高精度な追跡・地図構築・描画を実現する単眼RGB SLAMシステムを提案した。
- ForesightNav: シーン想像による効率的な探索学習ナビゲーション2025/4/1
未探索領域の占有・意味情報を予測する想像モジュールを備え、長期的なナビゲーション目標を効率的に選択することで未知環境での探索性能を高める手法を提案。
- MAPLE: 一人称視点動画から学習した器用なロボット操作の事前知識のエンコードマニピュレーション2025/4/1
一人称視点の大規模動画から物体との接触点と手の姿勢を予測する特徴を学習し、それを用いて器用なロボット操作の政策を訓練する手法を提案。シミュレーションと実機の17自由度ハンドで有効性を示した。
- MP-SfM: 単眼表面事前分布によるロバストなStructure-from-Motion3次元復元2025/4/1
単眼深度・法線の事前分布をSfMに統合し、極端な視点変化や対称性による誤対応に強い屋内3次元復元を実現した。
- VidBot: 野生の2D人間動画から汎化可能な3D行動を学習し、ゼロショットロボットマニピュレーションを実現VLA2025/3/1
インターネット上の一人称RGB動画から3Dハンド軌跡を抽出し、粗から細へのアフォーダンス学習と拡散モデルでロボットのゼロショット操作を可能にするフレームワークを提案。
- 二視点ループ閉じによる再構築不要なスケーラブル軌道推定VSLAM2025/3/1
再構築を行わず、二視点ループ閉じと単眼深度事前分布を活用して、スケーラブルなVisual SLAMを実現する2GOシステムを提案。
- SG-Tailor: シーングラフ操作のための物体間常識関係推論シーングラフ/常識推論2025/3/1
シーングラフのノード追加やエッジ変更時に生じる矛盾を解消し、常識的な関係を自己回帰的に予測するモデルを提案。シーン生成やロボット操作に組み込み可能。
- FrontierNet: 視覚的手がかりで探索する学習モデル探索2025/1/1
RGB画像と単眼深度からフロンティアを提案し情報利得を予測する視覚ベースの探索システムを開発し、3D地図依存の手法より初期探索効率を15%改善した。
- PickScan: 手持ち操作による物体発見と再構成3D再構成2024/11/1
RGB-Dカメラで物体を持ち上げながら撮影し、物体ごとの3Dモデルを生成するクラス非依存な手法を提案。操作検出とマスク抽出により高精度な再構成を実現した。
- ロスト&ファウンド:一人称視点観測による3D動的シーングラフの変化追跡動的シーングラフ2024/11/1
一人称視点の記録から物体の6DoF姿勢を追跡し、動的シーングラフをオンライン更新する手法を提案。ロボットの教示・再現に応用可能。
- HoloSpot: 複合現実のドラッグ&ドロップによる直感的な物体操作遠隔操作2024/10/1
スキャンした部屋を縮小模型のホログラムとして表示し、ドラッグ&ドロップで指示した物体操作をSpotロボットの実動作に変換するMRインターフェースを開発した。
- SpotLight: インタラクションとアフォーダンス検出によるロボットのシーン理解アフォーダンス2024/9/1
VLMを用いたアフォーダンス予測で照明スイッチの操作を実現し、物理的インタラクションを通じてシーングラフの関係を学習するフレームワークを提案。
- どこを見るべきかを学習:幾何情報を用いた能動的定位のための自己教師あり視点選択能動的定位2024/7/1
幾何情報を活用した自己教師あり学習により、ロボットが定位精度を高めるための視点をリアルタイムに選択する手法を提案し、合成・実データで既存手法を上回る性能を示した。
- MAP-ADAPT: リアルタイム品質適応型セマンティック3Dマップセマンティックマッピング2024/6/1
RGBDフレームから、シーンの意味情報と幾何学的複雑さに応じて領域ごとに品質を変える単一のセマンティック3Dマップをリアルタイム生成する手法。
- ロボティクスにおけるNeRF:サーベイNeRF2024/5/1
NeRFのロボティクスへの応用と、ロボティクス展開に向けたNeRF自体の改良に関する研究を体系的にまとめたサーベイ論文。
- LLMが3D世界へ:マルチモーダル大規模言語モデルによる3Dタスクのサーベイとメタ分析3D-LLM2024/5/1
LLMを3D空間データに統合する3D-LLMの研究を、点群からNeRFまでの表現、シーン理解・対話・ナビゲーションなどのタスク、課題と将来展望まで体系的に整理したサーベイ。
- Spot-Compose: 点群におけるオープンボキャブラリ物体検索と引き出し操作のフレームワークマニピュレーション2024/4/1
市販の3Dスキャナで得た点群を使い、オープンボキャブラリなインスタンス分割と把持姿勢推定を組み合わせて、実環境で物体の動的ピッキングと引き出し開けを行うフレームワークを構築した。
- F$^3$Loc: フロアプラン自己位置推定のための融合とフィルタリング自己位置推定2024/3/1
フロアプラン上での自己位置推定を、単一・多視点の深度予測を融合した確率的モデルと時間フィルタリングで高精度・リアルタイムに実現した研究。
- SNI-SLAM: Semantic Neural Implicit SLAM2023/11/1
- Nothing Stands Still: A Spatiotemporal Benchmark on 3D Point Cloud Registration Under Large Geometric and Temporal Change2023/11/1
- Leveraging Neural Radiance Fields for Uncertainty-Aware Visual Localization2023/10/1
- A 3D Mixed Reality Interface for Human-Robot Teaming2023/10/1
- Active Visual Localization for Multi-Agent Collaboration: A Data-Driven Approach2023/10/1
- Volumetric Semantically Consistent 3D Panoptic Mapping2023/9/1
- The Drunkard's Odometry: Estimating Camera Motion in Deforming Scenes2023/6/1
- Learning-Based Dimensionality Reduction for Computing Compact and Effective Local Feature Descriptors2022/9/1
- Spatial Computing and Intuitive Interaction: Bringing Mixed Reality and Robotics Together2022/2/1
- Panoptic Multi-TSDFs: a Flexible Representation for Online Multi-resolution Volumetric Mapping and Long-term Dynamic Scene Consistency2021/9/1
- MBA-VO: Motion Blur Aware Visual Odometry2021/3/1
- Freetures: Localization in Signed Distance Function Maps2020/10/1
- LIC-Fusion 2.0: LiDAR-Inertial-Camera Odometry with Sliding-Window Plane-Feature Tracking2020/8/1
- Infrastructure-based Multi-Camera Calibration using Radial Projections2020/7/1
- OmniSLAM: Omnidirectional Localization and Dense Mapping for Wide-baseline Multi-camera Systems2020/3/1
- Robust Dense Mapping for Large-Scale Dynamic Environments2019/5/1
- Incremental Visual-Inertial 3D Mesh Generation with Structural Regularities2019/3/1
- Episodic Curiosity through Reachability2018/10/1
- Efficient 2D-3D Matching for Multi-Camera Visual Localization2018/9/1
- Real-Time Dense Mapping for Self-driving Vehicles using Fisheye Cameras2018/9/1
- Project AutoVision: Localization and 3D Scene Perception for an Autonomous Vehicle with a Multi-Camera System2018/9/1
- TrimBot2020: an outdoor robot for automatic gardening2018/4/1
- Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark2017/4/1