Shenlong Wang
University of Illinois Urbana-Champaign
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SAM-V: マルチビューインスタンスセグメンテーションのための幾何認識型Segment Anythingセグメンテーション2026/9/21
フィードフォワード幾何モデル(VGGT)の特徴を2Dセグメンテーション基盤モデル(SAM)に統合し、オフラインのマスクマッチングや3D再構成なしで、単一の順伝播でマルチビューに一貫したインスタンスセグメンテーションを実現した。
- FIRE3D: 1分以内のフィードフォワード対話型3Dシーン再構築3D再構築2026/9/8
単一のRGB画像またはカジュアルなRGBビデオから、1分以内にシミュレーション対応の3Dシーンアセットを生成する統一フレームワークを提案。フィードフォワードのエンドツーエンドネットワークにより、各オブジェクトのポーズ、バウンディングボックス、メッシュ、テクスチャを予測し、物理的に分離された対話可能なシーンを構築する。
- MUSE: 状態推定のマルチモーダル不確実性定量化状態推定2026/5/1
視覚慣性オドメトリの不確実性をリアルタイムで定量化する学習ベースのフレームワークを提案し、Mambaを用いて複数の非同期センサストリームから推定の信頼性を評価する。
- MoRight: モーション制御を正しく行う動画生成2026/4/1
ユーザー指定の動作で物体の動きを制御しつつ、カメラ視点も自由に変えられる動画生成フレームワークを提案。能動的動作と受動的反応を分離して因果関係を学習し、順方向・逆方向の推論を可能にした。
- SAGE: 身体性AIのためのスケーラブルなエージェント型3Dシーン生成sim2real2026/2/1
ユーザーが指定した身体性タスクを理解し、複数の生成器と評価器を組み合わせて物理的に妥当でシミュレータ対応の3D環境を自動生成するエージェントフレームワークを提案。
- 上手くいく動作を模倣:人間動画からのシミュレーション選別モジュール型方策学習マニピュレーション2026/2/1
人間の動画から把持後の動作を学び、シミュレーションで把持の適合性を選別することで、ロボットデータなしに精密なマニピュレーションを実現するモジュール型方策学習フレームワークを提案。
- VisualSync: クロスビュー物体運動によるマルチカメラ同期マルチカメラ同期2025/12/1
複数の未同期・未校正カメラ映像から、共通して見える動物体のエピポーラ制約を利用してミリ秒精度で時間同期を取る最適化フレームワークを提案。
- 人間のための環境で人間らしくナビゲーションするロボットシステムナビゲーション2025/9/1
視覚言語モデルの推論能力を活用し、標識の読み取りや道案内の依頼といった人間らしい行動を組み込んだモジュール式ナビゲーションシステムを提案し、大規模複雑な建物内での効率的な移動を実現した。
- DRAWER: 実環境のリアリズムを備えたデジタル再構築と関節構造の再現sim2real2025/4/1
室内シーンの動画から、細部まで再現されたフォトリアルで操作可能なデジタル環境を自動生成するフレームワークを提案し、ゲーム制作やロボティクスのsim-to-real転移に応用した。
- PhysTwin: 動画からの物理情報に基づく変形可能物体の再構成とシミュレーションsim2real2025/3/1
動的物体の少数視点動画から、ばね-質量モデルとガウシアンスプラッティングを組み合わせて物理的にリアルなデジタルツインを再構成し、リアルタイム対話型シミュレーションやロボット動作計画を可能にするフレームワーク。
- 操作を伴うマッピングのための地図空間信念予測マニピュレーション2025/2/1
ロボットが散らかった棚から物体を効率的に見つけるため、地図空間での信念更新をニューラルネットで行い、不確実性を考慮した計画を可能にする手法を提案。
- タスク・パラメータ・ネクサス:モデルベース制御のためのタスク特化型パラメータ学習モデルベース制御2024/12/1
深層ニューラルネットワークを用いて、任意の追従タスクに対するモデルベース制御器の最適制御パラメータをオンラインで予測する手法を提案し、クアッドロータで未見タスクへの汎化性能を実証した。
- LidarDM:生成された世界における生成的LiDARシミュレーションLiDAR生成/自動運転シミュレーション2024/4/1
潜在拡散モデルで3Dシーンと動的アクターからなる4D世界を生成し、その中で時間的に一貫したリアルなLiDAR点群列を生成するモデルを提案。
- RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation2024/2/1
- DiffTune-MPC: Closed-Loop Learning for Model Predictive Control2023/12/1
- On the Overconfidence Problem in Semantic 3D Mapping2023/11/1
- ContactGen: Generative Contact Modeling for Grasp Generation2023/10/1
- MapPrior: Bird's-Eye View Map Layout Estimation with Generative Models2023/8/1
- Sim-on-Wheels: Physical World in the Loop Simulation for Self-Driving2023/6/1
- DiffTune$^+$: Hyperparameter-Free Auto-Tuning using Auto-Differentiation2022/12/1
- PEANUT: Predicting and Navigating to Unseen Targets2022/12/1
- DiffTune: Auto-Tuning through Auto-Differentiation2022/9/1
- Virtual Correspondence: Humans as a Cue for Extreme-View Geometry2022/6/1
- GeoSim: Realistic Video Simulation via Geometry-Aware Composition for Self-Driving2021/1/1
- Asynchronous Multi-View SLAM2021/1/1
- Deep Feedback Inverse Problem Solver2021/1/1
- SceneGen: Learning to Generate Realistic Traffic Scenes2021/1/1
- Deep Parametric Continuous Convolutional Neural Networks2021/1/1
- Learning to Localize Using a LiDAR Intensity Map2020/12/1
- Learning to Localize Through Compressed Binary Maps2020/12/1
- Pit30M: A Benchmark for Global Localization in the Age of Self-Driving Cars2020/12/1
- Identifying Unknown Instances for Autonomous Driving2019/10/1
- Exploiting Sparse Semantic HD Maps for Self-Driving Vehicle Localization2019/8/1
- Deep Rigid Instance Scene Flow2019/4/1