Paul Pu Liang
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA非視線知覚触覚
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GEM-4D: ロボット操作のための幾何学強化ビデオワールドモデルVLA2026/5/1
ビデオ生成モデルに4次元対応関係の教師信号を注入し、外観と幾何構造を同時に学習させることで、物理的に一貫した未来予測とロボット操作への直接適用を可能にした。
- DENALI: 低コストLiDARによる非視線空間推論を可能にするデータセット非視線知覚2026/4/1
消費者向けLiDARの内部記録である時空間ヒストグラムを用いて、隠れた物体の認識をデータ駆動で行うための大規模実世界データセットDENALIを構築し、低コストLiDARでの非視線知覚の可能性を示した。
- OpenTouch: 実世界インタラクションに全手触覚をもたらす触覚2025/12/1
一人称視点の動画と全手の触覚・姿勢を同期した初の実世界データセットを構築し、触覚が把持理解やクロスモーダル alignment に有効であることを示した。
- 手続き生成されたオープンエンド行動環境における視覚・言語・行動モデルのベンチマークVLA2025/5/8
Procgenの多様な手続き的タスクでVLM/VLAモデルのゼロショット汎化性能を評価するベンチマークMultiNet v0.2を提案し、OODタスクでの限界やアーキテクチャ設計の重要性を明らかにした。
- ロボット学習タスクにおける視覚・言語・行動モデルのベンチマーク評価VLA2024/11/1
GPT-4oやOpenVLAなど3つのVLAモデルを20種類の操作タスクで評価し、性能のばらつきや多段階計画の難しさを明らかにした。