Luc Van Gool
INSAIT
収録論文 56本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 2D VLMを3Dプログラマに変えるタスク適応型グラウンディングVLA2026/10/1
2Dの視覚言語モデルに座標系の統一とタスク適応フィードバックを組み合わせ、再学習なしで3D理解・操作・生成を可能にするフレームワーク3D-Progを提案。
- φ-RIE: フォトリアリスティック再構成からインタラクティブ環境へsim2real2026/9/22
3Dガウススプラッティングで再構成したシーンから、選択した物体をシミュレータで動かせるアセットに変換し、背景も補完してインタラクティブ環境を構築するパイプラインを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- CoRef-GS: マルチエージェント協調型参照3DガウシアンスプラッティングVLA2026/9/17
複数ロボットが各自構築した3Dガウシアンマップを統合し、言語クエリで対象物を特定する協調型シーン理解フレームワークを提案。
- 配向距離場によるイベントベースのモーション推定イベントカメラ/モーション推定2026/8/25
イベントカメラの動き推定を、反復最適化の代わりに事前計算した距離場の平均化で行う手法を提案し、低遅延かつ高精度を実現。さらに、ぼけ除去と瞳孔追跡への応用も示した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- ProOOD: プロトタイプ誘導による分布外3D占有予測3D占有予測2026/4/1
自動運転向けの3D占有予測において、長尾クラスバイアスと分布外入力への脆弱性を軽減する、プロトタイプ誘導の軽量プラグアンドプレイ手法を提案した。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- 写真カメラにおける普遍的計算収差補正に向けて:包括的ベンチマーク分析計算収差補正2026/3/1
多様なレンズに汎用な計算収差補正のための大規模ベンチマークUniCACを構築し、24手法を比較評価して性能に影響する3要因を特定した。
- AR-VLA: 視覚言語行動モデルのための真の自己回帰型アクションエキスパートVLA2026/3/1
観測ごとに時間的文脈をリセットする従来のVLAや拡散ポリシーと異なり、長期記憶で履歴を保持し連続的な因果系列として行動を生成する自己回帰型アクションエキスパートを提案。再アンカリング機構で非同期な視覚・言語・行動を同期させ、滑らかで文脈認識型の行動生成を実現した。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- SPEAR-1: 3D理解によるロボット実演を超えるスケーリングVLA2025/11/1
非ロボット画像に3D注釈を付与してVLMを強化し、3D認識と言語指示制御を統合したロボット基盤モデルSPEAR-1を提案。ロボット実演を20分の1に抑えつつ最先端性能を達成。
- 微分可能シミュレーションを用いた探索による自動運転の経路計画経路計画2025/11/1
微分可能シミュレータWaymaxを次状態予測器と評価器として活用し、勾配降下と確率的探索を組み合わせて行動系列を最適化する経路計画手法DSSを提案した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- 行動ラベルなしデータを活用した汎用ロボットマニピュレーションマニピュレーション2025/9/1
人間やロボットの行動動画から3D点群の動きを自己教師あり学習し、少数のラベル付きデータで行動予測器に調整することで、ラベルなしでも新しいタスクを学習できる汎用マニピュレーション手法を提案。
- DGFusion: 深度誘導型センサフュージョンによる堅牢な意味知覚センサフュージョン2025/9/1
LiDARの深度情報を活用し、シーン内の奥行きに応じてセンサ信頼度を動的に調整するマルチモーダル融合手法を提案。悪条件下でも高精度なセマンティック・パノプティックセグメンテーションを実現。
- スキャンから行動へ:実世界スキャンを活用した身体性シーン理解シーン理解2025/7/1
実世界の3Dスキャンデータと注釈をUSDで統合し、LLMによるシーン編集とロボットシミュレーションでの政策学習に応用した研究。
- GaussianVLM: 言語対応ガウシアンスプラットによるシーン中心3D視覚言語モデルVLA2025/7/1
3Dガウシアンスプラットに言語特徴を直接埋め込み、物体検出器に依存せずに3Dシーン理解と身体性推論を行う視覚言語モデルを提案した。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- 解析的世界モデルによる効率的な車両ダイナミクスモデリングの実現自動運転2025/2/1
微分可能シミュレータを状態予測器と組み合わせることで、相対オドメトリ、最適プランナ、最適逆状態を学習する解析的世界モデル(AWM)を提案し、自動運転における意思決定を強化する。
- Articulate3D: 3Dシーンを汎用シーン記述として包括的に理解する3Dシーン理解2024/12/1
関節物体の高品質アノテーションを備えた3D屋内シーンデータセットArticulate3Dと、部位分割と運動属性を同時予測する統一フレームワークUSDNetを提案した論文。
- 微分可能シミュレータによる自動運転車両のエンドツーエンド制御自動運転2024/9/1
微分可能シミュレータと解析的方策勾配法を組み合わせ、Waymo大規模データセット上で自動運転車両の制御器を学習する手法を提案。
- ReVLA: ロボット基盤モデルの視覚的ドメイン制限を回復するVLA2024/9/1
既存のロボット基盤モデルが視覚的なドメイン外シーンに弱い問題を分析し、モデルマージによる段階的バックボーン復元で視覚汎化性能を回復させる手法を提案した。
- TrafficBots V1.5: 相対姿勢エンコーディングを用いた条件付きVAEとTransformerによる交通シミュレーション交通シミュレーション2024/6/1
CVAEベースのマルチエージェント方策と相対姿勢エンコーディング付きTransformerを組み合わせ、Waymo Open Sim Agents Challenge 2024で3位に入賞した交通エージェントの閉ループシミュレーション手法。
- GlORIE-SLAM: 大域最適化されたRGBのみの陰的エンコーディング点群SLAMSLAM2024/3/1
RGB画像のみを用いた高密度SLAMにおいて、ニューラル点群表現と単眼深度推定を組み合わせ、ループ閉じ込みとオンライン大域バンドル調整により高精度な追跡・マッピング・レンダリングを実現した。
- Residual Learning for Image Point Descriptors2023/12/1
- Real-Time Motion Prediction via Heterogeneous Polyline Transformer with Relative Pose Encoding2023/10/1
- EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation2023/6/1
- Event-Free Moving Object Segmentation from Moving Ego Vehicle2023/5/1
- Lidar Line Selection with Spatially-Aware Shapley Value for Cost-Efficient Depth Completion2023/3/1
- TrafficBots: Towards World Models for Autonomous Driving Simulation and Motion Prediction2023/3/1
- A Multiplicative Value Function for Safe and Efficient Reinforcement Learning2023/3/1
- L2E: Lasers to Events for 6-DoF Extrinsic Calibration of Lidars and Event Cameras2022/7/1
- Deep Interactive Motion Prediction and Planning: Playing Games with Motion Prediction Models2022/4/1
- P3Depth: Monocular Depth Estimation with a Piecewise Planarity Prior2022/4/1
- ZippyPoint: Fast Interest Point Detection, Description, and Matching through Mixed Precision Discretization2022/3/1
- End-To-End Optimization of LiDAR Beam Configuration for 3D Object Detection and Localization2022/1/1
- MonoCInIS: Camera Independent Monocular 3D Object Detection using Instance Segmentation2021/10/1
- Decoder Fusion RNN: Context and Interaction Aware Decoders for Trajectory Prediction2021/8/1
- End-to-End Urban Driving by Imitating a Reinforcement Learning Coach2021/8/1
- Learnable Online Graph Representations for 3D Multi-Object Tracking2021/4/1
- Understanding Bird's-Eye View of Road Semantics using an Onboard Camera2020/12/1
- Learning from Simulation, Racing in Reality2020/11/1
- Learning Accurate and Human-Like Driving using Semantic Maps and Attention2020/7/1
- Action Sequence Predictions of Vehicles in Urban Environments using Map and Social Context2020/4/1
- Don't Forget The Past: Recurrent Depth Estimation from Monocular Video2020/1/1
- Talk2Nav: Long-Range Vision-and-Language Navigation with Dual Attention and Spatial Memory2019/10/1
- Semantic Understanding of Foggy Scenes with Purely Synthetic Data2019/10/1
- Talk2Car: Taking Control of Your Self-Driving Car2019/9/1
- Learning a Curve Guardian for Motorcycles2019/7/1
- Automatic Tool Landmark Detection for Stereo Vision in Robot-Assisted Retinal Surgery2017/9/1
- Fast Scene Understanding for Autonomous Driving2017/8/1
- Semantic Instance Segmentation with a Discriminative Loss Function2017/8/1
- Low-Cost Scene Modeling using a Density Function Improves Segmentation Performance2016/5/1
- Fast Optical Flow using Dense Inverse Search2016/3/1