Rui Wang
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HIGS: 幾何・意味理解を統合する階層的暗黙グリッドシーン理解2026/9/29
マルチ解像度サブマップと統合クエリ機構で、幾何と意味の両方を扱う効率的でスケーラブルな階層的ニューラル場を提案した論文。
- AnyStep-WAM: 予算整合蒸留と適応推論によるワールドアクションモデルVLA2026/9/27
ワールドアクションモデルのノイズ除去ステップ数をタスクの難易度に応じて適応的に配分し、成功率を維持しつつ計算量を最大85%削減するフレームワークを提案。
- クロスブランチ競合を盾に:統合マルチモーダル画像編集における顔アイデンティティ保護画像編集/顔保護2026/7/18
統合マルチモーダルモデルによる無断の顔編集から身元を守るため、理解・生成の2ブランチの構造的整合性を崩す敵対的保護フレームワークCCSを提案した。
- Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへVLA2026/6/1
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
- バックドアに基づく視覚-言語-行動モデルの所有権検証手法VLA/セキュリティ2026/5/1
視覚-言語-行動モデル(VLA)にバックドア型の透かしを埋め込み、モデル公開後の所有権を検証するフレームワークGuardVLAを提案した。
- ロボットに触覚を感じさせる:身体化されたミラー共鳴のための視覚-触覚皮質アライメント触覚/視覚-触覚統合2026/5/1
視覚と触覚の表現を多層的に整合させることで、RGB画像からロボットハンド上の触覚信号を予測し、人間の触れ合いに対する反射的な応答を可能にするフレームワークを提案した。
- 何を無視し、何に反応するか:VLAモデルの視覚的に頑健なRLファインチューニングVLA/RLファインチューニング2026/5/1
VLAモデルのRLファインチューニングにおいて、視覚変化がタスクに無関係か挙動変更を要するかを区別する補助目的を追加し、視覚的頑健性を向上させるPAIR-VLAを提案した。
- 想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行マニピュレーション2026/5/1
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
- ノイズ空間におけるチャンク境界アーティファクトの帰属と制御VLA2026/3/1
生成的な視覚運動ポリシーにおけるチャンク境界の実行不連続性を分析可能なメカニズム変数として扱い、潜在ノイズの操作で系統的に制御でき、タスク結果に影響を与えることを示した。
- SA-VLA: 空間認識型フローマッチングによる視覚-言語-行動強化学習VLA2026/2/1
フローマッチング型VLAポリシーの強化学習適応時に空間的帰納バイアスが失われる問題に対し、空間表現の融合・幾何学的進捗に基づく密報酬・空間条件付き探索戦略を組み合わせ、空間分布シフト下での汎化性能を高める手法を提案。
- 運動予測と計画のスケーリング則運動予測・計画2025/6/1
自動運転における運動予測と計画タスクで、トランスフォーマーモデルの性能が計算量に対してべき乗則で向上することを示し、最適なモデルサイズとデータサイズの比率や推論時計算のスケーリングも分析した。
- 自律走行車の自己位置推定のためのエンドツーエンド学習に基づくマルチセンサフュージョン自己位置推定2025/3/1
不確かさ推定を不要にし、高次ニューラルネット特徴でセンサ情報を符号化するエンドツーエンドのマルチセンサフュージョン手法を提案し、実環境で精度とロバスト性を向上させた。
- RobotDiffuse: 冗長マニピュレータのための拡散モデルベース運動計画とROP障害物回避データセットマニピュレーション2024/12/1
拡散モデルと点群エンコーダ、エンコーダのみのTransformerを組み合わせ、冗長マニピュレータの滑らかな運動計画を実現。35M姿勢・0.14M障害物回避シーンを含む新データセットROPを公開。
- 視覚(慣性)オドメトリ評価における軌道アライメントのための時空間ハンドアイキャリブレーションキャリブレーション2024/4/1
視覚(慣性)オドメトリの評価で軌道を正解データに合わせる際、ノイズやドリフトに強い新しい時空間ハンドアイキャリブレーション手法を提案し、従来法より高精度で頑健であることを示した。
- VXP: ボクセル・クロス・ピクセルによる大規模画像-LiDAR位置認識位置認識2024/3/1
画像とLiDARスキャンの局所対応を自己教師ありで学習し、両モダリティを共有特徴空間に統合するクロスモーダル位置認識フレームワークVXPを提案。3つのベンチマークで最先端手法を大きく上回る精度を達成した。
- F$^3$Loc: フロアプラン自己位置推定のための融合とフィルタリング自己位置推定2024/3/1
フロアプラン上での自己位置推定を、単一・多視点の深度予測を融合した確率的モデルと時間フィルタリングで高精度・リアルタイムに実現した研究。
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1
- Leveraging Neural Radiance Fields for Uncertainty-Aware Visual Localization2023/10/1
- Lifelike Agility and Play in Quadrupedal Robots using Reinforcement Learning and Generative Pre-trained Models2023/8/1
- Safe, Occlusion-Aware Manipulation for Online Object Reconstruction in Confined Spaces2022/5/1
- Lazy Rearrangement Planning in Confined Spaces2022/3/1
- Persistent Homology for Effective Non-Prehensile Manipulation2022/2/1
- Efficient and High-quality Prehensile Rearrangement in Cluttered and Confined Spaces2021/10/1
- Online Object Model Reconstruction and Reuse for Lifelong Improvement of Robot Manipulation2021/9/1
- Exploring Imitation Learning for Autonomous Driving with Feedback Synthesizer and Differentiable Rasterization2021/3/1
- Generalization Through Hand-Eye Coordination: An Action Space for Learning Spatially-Invariant Visuomotor Control2021/3/1
- Uniform Object Rearrangement: From Complete Monotone Primitives to Efficient Non-Monotone Informed Search2021/1/1
- A novel control mode of bionic morphing tail based on deep reinforcement learning2020/10/1
- Safe and Effective Picking Paths in Clutter given Discrete Distributions of Object Poses2020/8/1
- Grasp State Assessment of Deformable Objects Using Visual-Tactile Fusion Perception2020/6/1
- Learn the Manipulation of Deformable Objects Using Tangent Space Point Set Registration2018/10/1