Zhijie Deng
SJTU
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーション触覚/操作VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Streaming-WAM: 非同期ロボットマニピュレーションのための行動条件付きワールドアクションモデルマニピュレーション2026/9/24
未来の視覚予測を行動条件付きで行い、推論とロボット動作を非同期に重ねることで待ち時間を削減しつつ高い成功率を実現したモデル。
- TacBPM: 触覚条件付き行動事前モデルによる巧みな再配向マニピュレーション2026/9/16
触覚と固有感覚の履歴を条件とする潜在行動事前モデルを学習し、残差潜在行動で下流方策を効率的に訓練することで、多様な物体の巧みな手内再配向と把持・運搬タスクを実現した。
- TacForcing: 実行時触覚フィードバックによるストリーミング動作生成触覚/操作2026/8/26
接触を伴う操作タスクで、実行中に変化する触覚情報を動作生成に取り込む新しいフレームワークを提案。別の高周波コントローラを使わず、ストリーミング動作エキスパートと実行時触覚アテンションで性能を向上させた。
- 世界・言語・行動モデル:統一的世界モデリング、言語推論、行動合成VLA2026/6/4
テキスト指示、画像、ロボット状態から、テキストのサブタスク、サブゴール画像、ロボット行動を同時予測する新しい基盤モデルWLAを提案。ARトランスフォーマーを用いて世界予測と言語推論を統合し、推論時には世界予測を無効化できる。
- LatentUM: 潜在空間統合モデルによるインターリーブ型クロスモーダル推論の可能性を解き放つVLA2026/4/2
視覚理解と生成を共通の潜在空間で表現する統合モデルLatentUMを提案し、ピクセル空間を介さずに柔軟なクロスモーダル推論と生成を実現した。
- LoHoVLA:長期的な身体タスクのための統合視覚言語行動モデルVLA2025/6/1
大規模視覚言語モデルを基盤に、言語と行動トークンを統合生成し、階層的閉ループ制御で長期的身体タスクを遂行するVLAフレームワークを提案。