Zhidong Deng
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DynaWM: ベースVLA誘導による移動物体操作のための世界基盤モデルVLA/操作2026/7/1
移動物体操作のための世界モデルを提案。ベースVLAの性能を保ちつつ、Mamba-3とV-JEPA 2.1を用いて動作軌道を生成し、新ベンチマークDynaGrasp-32で評価した。
- ACE: ゼロショットワークフロー推論による身体的操作のためのエージェント制御マニピュレーション2026/7/1
テーブル上のピックアンドプレース操作を自然言語指示からゼロショットで実行するフレームワークACEを提案。ワークフロー推論と視覚接地・再利用可能なプリミティブを組み合わせ、実行失敗を検出して適応する。
- 小型VLAモデルに「どこを見るか」と「どう動くか」を教えるVLA2026/7/1
小型の視覚言語行動モデルに、空間的接地と行動生成の能力を効率的に教えるフレームワークXS-VLAを提案。蒸留とフローマッチングにより、実時間制御に適した小型モデルの性能を大幅に向上させた。
- VistaRef: 指差し物体検出のための視覚的空間方位認識の強化物体検出2026/6/23
指差しジェスチャーによる物体検出の精度を高めるため、手の姿勢エンコーディングと幾何学的レイモデリングを導入し、空間方位認識を明示的に強化するフレームワークを提案した。
- OpenSPM: 環境転移可能なロボット用空間キーポーズ記憶と閉ループ高周波フローマッチング行動生成モデルマニピュレーション2026/6/1
オープン環境でのテーブルトップ操作を対象に、意味的3D知覚とカルマンフィルタで6Dポーズを追跡し、人間のデモから抽出した空間キーポーズを記憶として利用、推論時に自然言語指示で検索・転移してフローマッチングモデルで高周波行動を生成する枠組みを提案した。
- Key-Gram: 身体化操作のための拡張可能な世界知識操作2026/5/1
言語由来の世界知識を視覚状態推論から分離する条件付きメモリフレームワークKey-Gramを提案し、指示をタスク固有のキーグラムに分解して外部メモリから検索・注入することで、バックボーンの視覚推論能力を保ちつつ知識拡張を容易にした。
- FUTURE-VLA: 実時間実行下での統合軌道予測VLA2026/2/1
長時間の映像履歴を効率的に圧縮し、潜在空間での自己回帰により将来の視覚予測と行動生成を単一のフォワードパスで行うVLAアーキテクチャを提案。予測に基づく人間参加型の実行ゲーティングも実現した。