Jiale Cao
収録論文 3本 ・ フィジカルAI/ロボット学習
VLAシーン生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniFS: 視覚言語行動モデルのための統合高速-低速階層アーキテクチャVLA2026/6/1
人間の脳の多時間スケール処理に着想を得て、VLM層を更新頻度の異なるグループに階層化し、潜在ベクトル反転機構と多レベル監視戦略を導入することで、高速-低速の周波数ジレンマを解決する新しいVLAアーキテクチャを提案した。
- GeoVLA: 視覚言語行動モデルに3D表現を導入VLA2025/8/1
深度マップから点群を生成し、視覚言語モデルの埋め込みと統合することで、3D空間認識を強化したロボットマニピュレーション用VLAフレームワークを提案。
- Glad: 自動運転のためのストリーミングシーン生成器シーン生成2025/3/1
潜在変数伝播とストリーミングサンプラーにより、フレーム単位で時間的一貫性のある運転シーンの動画を生成するフレームワークを提案。