Wei Sui
D-Robotics
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RawVLA: ロボットマニピュレーションのための身体性ニューラル画像信号処理プロセッサVLA2026/9/29
VLAモデルが通常使うRGB画像処理(ISP)を見直し、RAWデータから適応的に画像を生成するニューラルISPを提案。劣化した撮像条件下でもマニピュレーションの頑健性を大幅に向上させた。
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- Uranus: 身体性AIのための次世代シミュレーション基盤の構築sim2real2026/9/21
関節軌道条件付き自己回帰拡散モデルを用いたデータ駆動型ロボットシミュレータUranusを提案し、ストリーミング生成、低遅延、多様なロボット制御に対応した。
- 足場制約地形におけるヒューマノイドのためのワールドモデル拡張視覚歩行歩行2026/9/2
本研究では、不連続な足場制約地形でのヒューマノイド歩行を改善するため、リカレントワールドモデルとPPOポリシーを共同訓練するWM-LOCOを提案し、シミュレーションと実機で高い成功率を達成した。
- Faster-WAM: ロバストな世界行動モデルのための効率的な推論時未来条件付けロボット操作2026/8/5
世界行動モデル(WAM)の推論時における未来条件付けの重要性を示し、計算コストを抑えつつ未来表現を活用する効率的なフレームワークFaster-WAMを提案した。
- DreamWAM: RGBを超えた未来予測による世界行動モデルVLA2026/8/1
世界行動モデル(WAM)の未来予測をRGBだけでなく、外観・動き・幾何・意味の構造化表現で行うことで、ロバストな行動学習を実現した。
- TrustVLA:メカニズムに基づく推論時防御による視覚言語行動モデルのバックドア対策VLA/セキュリティ2026/7/1
視覚言語行動(VLA)モデルに対するバックドア攻撃を、内部メカニズムの分析に基づいて推論時に検出・防御する手法を提案した。
- SkillNav: スコアレベルスキル介入によるゼロショット物体目標ナビゲーションナビゲーション2026/7/1
VLMベースのナビゲーションエージェントに、地図上の好奇心価値マップを書き換える形で行動記憶を埋め込むスキルフレームワークを提案し、追加トークンなしでデッドエンドやループなどの失敗を軽減する。
- EA-Nav: 身体性を考慮した安全な視覚ナビゲーションポリシーの学習ナビゲーション2026/7/1
異なる身体性を持つエージェント間でのナビゲーション性能を向上させるため、模倣学習に基づく身体性認識フレームワークを提案し、身体形状を条件付けトークンとして導入して行動の曖昧性を低減し、軌道拡張で高リスクサンプルを生成して安全なナビゲーションを実現した。
- ヒューマノイド全方位占有予測:身体化AIのためのステレオベース全周囲占有データセットデータセット/占有予測2026/6/1
ヒューマノイドロボット向けに、ステレオカメラを用いた大規模な全周囲占有データセットを構築し、Real2Sim2Realパイプラインで実環境への汎化を実証した。
- dVLA-RL: 離散拡散ビジョン・ランゲージ・アクションモデルに対する軌跡上の強化学習VLA/強化学習2026/6/1
離散拡散型VLAモデルの強化学習を可能にするため、生成過程をマルコフ決定過程とみなし、軌跡の結合確率を目的関数とする手法を提案した。
- 軌道標準化によるロボット模倣学習の改善模倣学習2026/6/1
人間のデモンストレーション軌道の速度むらや冗長な停止を情報距離に基づいて再サンプリングする前処理手法ISRを提案し、実世界の操作タスクで成功率を約25%向上させた。
- HoloAgent-0: 3D空間メモリを備えた統合具現化エージェントフレームワークVLA2026/6/1
言語指示を実行可能なスキルグラフに変換し、3D空間メモリとロボットスキルを統合して実ロボットで閉ループ実行を実現する統一エージェントフレームワークを提案した。
- MotionVLA: 幾何学的な動きを視覚言語行動モデルに注入するVLA2026/6/1
過去のフレームを記憶する代わりに、連続的な軌跡フィールドトークンとして動きを表現し、ロボットの長期的な操作タスクの性能と滑らかさを向上させる手法を提案した。
- Rein3D: パノラマビデオ拡散モデルによる強化学習型3D屋内シーン生成3Dシーン生成2026/4/12
3Dガウススプラッティングとビデオ拡散モデルを組み合わせ、疎な入力から360度の一貫した3D屋内シーンを復元・生成するフレームワークを提案した。
- GS-Playground: 視覚に基づくロボット学習のための高スループット写実的シミュレータシミュレーション2026/4/1
3Dガウススプラッティングと並列物理エンジンを統合した高速写実シミュレータを開発し、視覚ベースの強化学習を大規模に加速する。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- IRIS-SLAM: 幾何・インスタンス統合表現による堅牢な意味論的定位とマッピングSLAM2026/2/1
幾何基盤モデルを拡張して密な幾何と視点間で一貫したインスタンス埋め込みを同時予測し、意味論的に対応付けられたループ閉じ込み検出を可能にしたRGB意味論SLAMシステムを提案。
- DPNet: ドップラーLiDARを用いた高ダイナミック環境向け動作計画動作計画2025/12/1
ドップラーLiDARの速度情報を活用し、高速移動障害物を追跡・予測するニューラルネットワークとモデル予測制御を組み合わせた動作計画手法を提案。
- MarketGen: 自動生成される実体化スーパーマーケット環境を備えたスケーラブルなシミュレーションプラットフォームsim2real2025/11/1
スーパーマーケット環境を自動生成するシミュレーションプラットフォームMarketGenを提案し、レジ袋詰めと棚からの商品収集という2つのタスクのベンチマークを構築した。
- VO-DP: 視覚のみのロボットマニピュレーションのための意味・幾何適応拡散ポリシーマニピュレーション2025/10/1
視覚基盤モデルを活用し、意味特徴と幾何特徴を融合する視覚のみの拡散ポリシーを提案。点群ベース手法に匹敵または凌駕する成功率を実世界タスクで達成。
- SIG-Chat: 空間意図に導かれた対話ジェスチャー生成 — いつ・どのように・どこでジェスチャー生成2025/9/1
音声・言語・空間情報を統合し、対話相手とのインタラクションのタイミングや方向を考慮したジェスチャーを生成するモデルを提案し、ヒューマノイドロボットに実装した研究。
- FSR-VLN: 階層的マルチモーダルシーングラフによる視覚言語ナビゲーションの高速・低速推論VLA2025/9/1
階層的マルチモーダルシーングラフと高速・低速推論を組み合わせ、長距離視覚言語ナビゲーションの成功率を向上させつつ応答時間を82%削減し、ヒューマノイドロボットに実装した。
- DISCOVERSE: 複雑で高忠実度な環境における効率的なロボットシミュレーションsim2real2025/7/1
3DガウススプラッティングとMuJoCoを組み合わせ、実世界の複雑な環境を高精細に再現してロボット学習を行うオープンソースのReal2Sim2Realシミュレーションフレームワークを提案し、模倣学習におけるゼロショットSim2Real転移で最先端性能を示した。
- EmbodiedGen: 身体性知能のための生成的3D世界エンジンsim2real2025/6/1
物理的リアリティと正確なスケールを持つ3Dアセットを低コストで生成し、物理シミュレーションに直接インポート可能な基盤プラットフォームを提案。
- 効率的なタスク特化型条件付き拡散ポリシー:ショートカットモデルによる加速とSO(3)最適化模倣学習/拡散ポリシー2025/4/1
拡散ポリシーの推論をショートカットモデルで高速化し、回転推定をSO(3)多様体上で扱うことで、リアルタイムロボット制御を可能にした研究。
- GeoFlow-SLAM:動的脚式ロボティクスのための堅牢な密結合RGBD慣性・脚式オドメトリ融合SLAMSLAM2025/3/1
高速・高頻度動作する脚式ロボット向けに、幾何学的整合性・脚式オドメトリ・デュアルストリームオプティカルフローを統合し、特徴マッチングや姿勢初期化の失敗、テクスチャレス環境での視覚特徴不足を解決する密結合RGBD慣性SLAMを提案。
- 関節空間での分離特徴アライメントによる軽量オープンセット物体検出フレームワークオープンセット物体検出2024/12/1
VLMと検出器をMLPアダプタで結合し、テキスト埋め込みを関節空間に変換してクラス非依存の領域表現と直接アライメントすることで、高精度かつリアルタイムなオープンセット物体検出を実現した軽量フレームワーク。
- Towards Accurate Ground Plane Normal Estimation from Ego-Motion2022/12/1
- Deep Online Correction for Monocular Visual Odometry2021/3/1