Peng Wang
US Army Research Laboratory
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 三モーダル整合性誘導フロートランスフォーマーによる効率的な視覚-言語-行動ポリシー学習VLA2026/9/28
視覚・言語・行動の三モーダル整合性を明示的に強制する損失を導入し、フローマッチング目的で推論を高速化したVLAモデルAGFTを提案。ベンチマークで成功率向上と低遅延を実現。
- LEAP-NBV: 基盤モデルによる次善視点計画のための軽量エッジ能動知覚能動知覚2026/9/21
大規模なHuman Mesh Recoveryモデルを蒸留・量子化してエッジデバイス上で動作させ、オクルージョン対応の能動知覚ループで次善視点計画をリアルタイム実行する軽量フレームワークを提案。
- ロボット多相インタラクション:世界モデルによる液体と固体の連成ダイナミクスの操作マニピュレーション2026/9/18
液体を含む多孔質材料(スポンジ)をロボットで操作する新設定を提案し、世界モデルと拡散方策を用いて液体と固体の連成状態を予測・制御する手法を開発した。
- RodForesight: 細長ロッド挿入のための世界モデル強化拡散ポリシーマニピュレーション2026/9/10
細長いロッドの挿入タスクを粗接近と予測挿入の2段階に分け、拡散ポリシーと行動条件付き世界モデルを組み合わせて挿入前に候補行動の効果を予測・選択することで成功率を向上させた学習フレームワーク。
- 5Hzで考え、20Hzで動く:閉ループ運転のための非同期高速・低速ビジョン言語行動推論自動運転2026/7/1
大規模言語モデルの推論遅延と車両制御レートのギャップを解消するため、低速のVLバックボーンと高速の行動エキスパートを非同期に組み合わせ、毎シミュレーションチックで新鮮な制御を生成するアーキテクチャを提案した。
- ThinkingVLA: ロボット操作のための視覚と言語の推論を交互に行う手法VLA2026/6/1
ロボット操作タスクにおいて、視覚と言語の推論を交互に行う統一アーキテクチャを提案し、長期的な操作タスクでの性能を向上させた。
- アンカー型ロボットキーポイントによる逐次プランニング操作計画2026/6/1
訓練不要のニューロシンボリック操作システムSPARKを提案し、LIBERO-PROベンチマークで既存手法を大幅に上回る成功率を達成した。
- Z-1: 視覚言語行動モデルのための効率的強化学習VLA/強化学習2026/6/1
フローベースのVLAモデルに強化学習を適用し、公開データセットのみで24タスクの成功率を大幅に向上させた。
- すべての特徴が平等ではない:視覚言語行動モデルの機構的研究VLA2026/3/1
視覚言語行動(VLA)モデルがマルチモーダル入力を行動に変換する仕組みを、活性化注入やスパースオートエンコーダなどを用いて分析し、視覚経路が行動生成を支配し、言語の重要性はタスク構造に依存することを明らかにした。
- UniBYD: 人間の模倣を超えた多様なロボットハンドの操作学習のための統合フレームワークマニピュレーション2025/12/1
ロボットと人間の身体差を超え、多様なロボットハンド形態に適応する操作方策を強化学習で獲得する統合フレームワークUniBYDを提案。動的PPOと影エンジンにより人間模倣を超えた適応的探索を実現。
- ScaleADFG: スケーラブルなデータセットによるアフォーダンスベースの巧みな機能把持マニピュレーション2025/11/1
ロボットの大きな手でも日常物体を機能的に把持できるよう、アフォーダンスに基づく自動データセット構築と軽量な把持生成ネットワークを提案した研究。
- 身体性AIエージェントのための世界モデルの安全性課題:レビュー世界モデル2025/10/1
自動運転とロボティクスにおける世界モデルの安全性をレビューし、最先端モデルの予測を収集・分析して一般的な故障を分類・定量評価した。
- DINOv3拡散方策:視覚運動拡散方策学習のための自己教師あり大規模視覚モデルVLA2025/9/1
ロボットマニピュレーションの拡散方策において、自己教師あり視覚バックボーンDINOv3が従来のImageNet教師ありResNet-18と同等以上に機能し、サンプル効率と頑健性を向上させることを示した。
- 回転同変な画像分類と物体検出のための四元数近似ネットワークロボット知覚2025/9/1
四元数畳み込みを実数演算で近似するQUANを提案し、回転に強い画像分類・物体検出を少ないパラメータで実現した。
- 非一様時間スケジューリングと密ジャンプ積分によるロボット政策のフローマッチングVLA2025/9/1
フローマッチング政策の推論時における多段積分の性能劣化を分析し、訓練時の非一様時間スケジューリングと推論時の密ジャンプ積分を提案して最大23.7%の性能向上を達成した。
- ロボティクス向け空間関係認識データセット空間推論2025/6/1
Spotロボットで取得した約1000枚の屋内画像に物体属性・位置・空間関係を注釈付けしたデータセットを構築し、シーングラフ生成モデルを評価した。
- ColorDynamic: 非構造・動的環境向けの汎用・スケーラブル・リアルタイムなエンドツーエンド局所プランナナビゲーション2025/2/1
生センサデータから直接制御指令を出力するエンドツーエンド強化学習と新ネットワークTransqerにより、非構造・動的環境でも90%超の成功率と1.2-1.3msのリアルタイム局所計画を実現した。
- ロボティックIoTのための再構成可能知能表面通信/群制御2024/12/1
再構成可能知能表面(RIS)を用いてロボットIoTネットワークの通信・センシング・計算・エネルギー効率を改善する手法を提案し、マルチエージェント強化学習と多目的最適化でビームフォーミングや経路計画などを最適化した。
- モーションブラー対応ガウススプラッティングSLAMSLAM2024/11/1
露光中のカメラ軌跡を推定してブレを補正し、NeRFや3DGSを用いたSLAMのローカライゼーションと地図再構成を高精度化した。
- 非専門家の観測データからの効果的なサブゴール誘導による目標到達方策学習強化学習2024/9/1
非専門家の行動なし観測データから長期的な目標到達方策を学ぶため、拡散モデルでサブゴールを生成し、状態-目標価値関数で効率的な探索を促す手法を提案した。
- 拡散モデルを最適化器として活用するオフライン強化学習の効率的計画法オフライン強化学習2024/7/1
拡散モデルのサンプリングを軌道生成と最適化に分離し、自己回帰モデルで高速に実行可能な軌道を生成しつつ拡散モデルで最適化することで、オフライン強化学習の計画を3〜10倍高速化した。
- 拡散モデルによる動画生成におけるロボットの形状と位置の保持拡散モデル2024/7/1
拡散モデルを用いて、移動ロボットの形状と位置を正確に保持した動画を生成する手法を提案し、衝突検出モデルの学習データ作成を容易にした。
- アシストロボットのための言語粒度とオンザフライ制御VLA2024/6/1
視覚が使えない状況でも言語のみでアシストロボットを制御できるか検討し、異なる粒度の言語指示への応答とオンザフライ制御の必要性・実現可能性をSawyerとTurtlebotで実験した。
- 身体性知能を備えた視覚言語ナビゲーション:サーベイVLA2024/2/1
視覚と言語指示を用いてエージェントが自律移動する視覚言語ナビゲーション(VLN)の研究を、身体性知能の観点から体系的に整理したサーベイ論文。
- LLM A*: Human in the Loop Large Language Models Enabled A* Search for Robotics2023/12/1
- AerialVLN: Vision-and-Language Navigation for UAVs2023/8/1
- Progressive Transfer Learning for Dexterous In-Hand Manipulation with Multi-Fingered Anthropomorphic Hand2023/4/1
- Generalized Anthropomorphic Functional Grasping with Minimal Demonstrations2023/3/1
- Learning Tri-mode Grasping for Ambidextrous Robot Picking2023/2/1
- Attacking Digital Twins of Robotic Systems to Compromise Security and Safety2022/11/1
- A Human-friendly Verbal Communication Platform for Multi-Robot Systems: Design and Principles2022/11/1
- DVGG: Deep Variational Grasp Generation for Dextrous Manipulation2022/11/1
- Fast-Spanning Ant Colony Optimisation (FaSACO) for Mobile Robot Coverage Path Planning2022/5/1
- Simultaneous Semantic and Collision Learning for 6-DoF Grasp Pose Estimation2021/8/1
- Organization and Understanding of a Tactile Information Dataset TacAct During Physical Human-Robot Interactions2021/8/1
- GPR: Grasp Pose Refinement Network for Cluttered Scenes2021/5/1
- Leveraging Structural Information to Improve Point Line Visual-Inertial Odometry2021/5/1
- Super Odometry: IMU-centric LiDAR-Visual-Inertial Estimator for Challenging Environments2021/4/1
- A Collaborative Visual SLAM Framework for Service Robots2021/2/1
- TP-TIO: A Robust Thermal-Inertial Odometry with Deep ThermalPoint2020/12/1