Renjun Wu
Beijing Institute of Technology
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA/操作VLA/触覚/操作プライバシー/攻撃移動操作拡散ポリシー/3D認識/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveWAM: 世界行動モデルのための証拠認識型能動視覚マニピュレーション2026/10/1
カメラとエンドエフェクタを同時に制御し、タスクに重要な証拠を保持しつつ新たな視点を取得する能動視覚マニピュレーションを、世界モデルと行動モデルを統合した枠組みで学習する手法を提案。
- SparkVLA: 長期的操作のための適応アクションチャンクを備えた停止認識型階層VLAVLA/操作2026/8/17
階層型VLAシステムにおけるサブタスクの停止タイミングとアクションチャンク長の相互依存関係を単一のランキング問題として定式化し、統一候補セットから最適解を選択する新しい手法を提案した。
- ViTaR: 基盤VLA操作のための視触覚残差適応VLA/触覚/操作2026/8/16
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
- VLALeaks: 視覚言語行動モデルに対するメンバーシップ推論攻撃プライバシー/攻撃2026/6/1
VLAモデルが訓練データを記憶することによるプライバシー漏洩リスクに着目し、注意の差異に基づくメンバーシップ推論攻撃を提案した。
- GeoHAT: 移動操作のための幾何適応型ハイブリッド行動変換器移動操作2026/6/1
移動操作タスクにおいて、信頼できる幾何情報のみを注入し、必要な箇所にのみ注意を向けるという原理に基づく、エンドツーエンドの拡散ベースフレームワークGeoHATを提案。軽量なフーリエ空間エンコーダとゲート付き融合、およびアームとベースを分離したハイブリッド行動デコーダにより、シミュレーションベンチマークで高い成功率を達成した。
- ReMAP-DP: 再投影マルチビュー整列ポイントマップによる拡散ポリシー拡散ポリシー/3D認識/操作2026/3/1
2D視覚表現に基づく汎用ロボットポリシーに明示的な3D空間認識を組み込むため、標準化された透視再投影と画素整列されたPointMapsを融合した二重ストリーム拡散ポリシーを提案し、シミュレーションと実世界の操作タスクで高い性能とデータ効率を実証した。