Fangfu Liu
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦するVLA2026/7/1
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
- GEM: 生成的監視が身体化知能を強化するVLA2026/5/27
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
- Gamma-World: 2人を超える生成型マルチエージェント世界モデル世界モデル2026/5/27
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
- HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデルVLA2026/4/8
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
- VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes2023/8/1