Jinkui Shi
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデルVLA2026/3/1
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。