Jiatao Gu
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PointAction: 3D点群をロボット制御の普遍的な行動表現として用いるVLA2026/6/2
ビデオ生成モデルを基盤に、将来のRGBフレームと動的3D点群を同時予測し、その点群の動きを行動デコーダでロボットの実行可能な行動に変換するフレームワークを提案。RGBのみの行動基盤の曖昧さを低減し、限られた行動教師データで異なるタスクやロボットへの転移を実現。
- OmniGuide:汎用ロボットポリシーを強化する万能ガイダンス場VLA2026/3/1
3D基盤モデルやVLMなどの多様なガイダンスを微分可能なエネルギー関数として表現し、VLAモデルの行動サンプリングを誘導することで、複雑な操作タスクの成功率と安全性を向上させるフレームワーク。
- STARFlow-V: 正規化フローによるエンドツーエンド動画生成モデリング動画生成2025/11/25
正規化フローを用いた動画生成モデルSTARFlow-Vを提案し、時空間潜在空間でのグローバル・ローカル構造とフロースコアマッチングにより、拡散モデルに匹敵する高品質な動画生成を実現した。