Pengfei Liu
Nanyang Technological University
収録論文 8本 ・ フィジカルAI/ロボット学習
HRIVLAVLA/ジェスチャー理解ロボット操作群制御
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- mmHRI: ミリ波レーダによるプライバシー保護型ヒューマンロボットインタラクションHRI2026/9/28
ミリ波レーダで人の動作と3D姿勢を推定し、それをテキスト指示に変換してVLAポリシーを制御する、プライバシー保護型のロボットマニピュレーション枠組みを提案した。
- RAVEL: フローベースVLAモデルのための非同期ローリング推論VLA2026/9/28
フローベースVLAのVLMエンコードと多段拡散による遅延を、非同期ローリングバッファと軽量観測経路で削減し、低遅延な閉ループ制御を実現した。
- 世界・言語・行動モデル:統一的世界モデリング、言語推論、行動合成VLA2026/6/4
テキスト指示、画像、ロボット状態から、テキストのサブタスク、サブゴール画像、ロボット行動を同時予測する新しい基盤モデルWLAを提案。ARトランスフォーマーを用いて世界予測と言語推論を統合し、推論時には世界予測を無効化できる。
- GIVE: 視覚言語行動モデルにおける人間のジェスチャーの接地VLA/ジェスチャー理解2026/6/1
人間のジェスチャーを視覚・意味の2経路でVLAモデルに統合し、曖昧な指示でも物体接地と操作意図の推定を改善する手法を提案。実世界実験で成功率を大幅に向上させた。
- フィードバックワールドモデルによる拡散ポリシーの精密なガイダンスロボット操作2026/5/1
実行時の観測を利用して予測誤差をオンライン補正するフィードバックワールドモデルを提案し、分布シフト下での予測精度とポリシー性能を向上させた。
- LatentUM: 潜在空間統合モデルによるインターリーブ型クロスモーダル推論の可能性を解き放つVLA2026/4/2
視覚理解と生成を共通の潜在空間で表現する統合モデルLatentUMを提案し、ピクセル空間を介さずに柔軟なクロスモーダル推論と生成を実現した。
- V-STC: 時間効率的な複数車両協調軌道計画手法群制御2026/4/1
複数の自動運転車両の協調軌道計画において、空間的配置と時間幅を同時に最適化する可変時間ステップ時空間コリドー(V-STC)を提案し、安全性を保ちつつ時間効率を向上させる。
- RTM3D: Real-time Monocular 3D Detection from Object Keypoints for Autonomous Driving2020/1/1