Jiafei Cao
Shanghai AI Laboratory
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA/敵対的攻撃VLAVLA/操作シミュレーション/自己中心視点
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 見えざる脅威:拡散モデルによる視覚言語行動モデルへの無制限ロボット攻撃VLA/敵対的攻撃2026/8/1
拡散モデルを用いて視覚的に自然な敵対的パッチを生成し、VLAモデルのロボット制御を攻撃する手法を提案。ホワイトボックスとブラックボックスの両設定で有効で、シミュレーションと実世界で既存手法を上回る性能を示した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。