Paul Pacaud
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 幾何学的潜在拡散による空間認識ワールドアクションモデルVLA2026/9/2
事前学習済みビデオ拡散モデルをRGBと深度の同時予測に拡張し、3D情報を活用したロボットポリシー学習を実現する空間認識ワールドアクションモデル(SA-WAM)を提案した。
- PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデルVLA2026/5/1
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
- 視覚言語ロボット操作のための環境横断的な失敗推論データのスケーリングVLA2025/12/1
成功軌道を摂動させて多様な失敗データを自動生成し、VLMで推論トレースを付与した大規模データセットFailCoTを構築。これで訓練した検証モデルGuardianは未知環境での失敗検出性能を向上させ、操作タスクの成功率を高めた。
- Gondola: 汎用ロボット操作のための接地視覚言語プランニングVLA2025/6/1
多視点画像と履歴プランから、対象物と位置のセグメンテーションマスクを伴う次行動プランを生成するLLMベースのモデルを提案し、GemBenchで汎化性能を向上させた。