Kaidi Zhang
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA操作VLA/触覚/操作マニピュレーション触覚
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PHR-VLA: 視覚言語行動モデルのための計画地平推論VLA2026/8/27
将来の観測から得た潜在ダイナミクスをVLAの内部表現に整列させる補助ヘッドを導入し、接触を伴う細かい操作タスクの成功率を向上させた。
- 接触豊富な操作における視覚-触覚世界モデルの重要要素:ContactWorld操作2026/6/1
接触を伴う操作タスクにおける視覚-触覚世界モデルの性能を、12種類のタスクで体系的に比較し、空間構造と時間連続性を持つ表現(特に点群と触覚力場)が計画性能を向上させることを示した。
- DREAM-Chunk: 潜在世界モデルによるリアクティブなアクションチャンキングVLA2026/6/1
アクションチャンキング方式のポリシーに軽量な潜在世界モデルを追加し、テスト時に複数の候補チャンクの未来を予測して最適なものを選択することで、確率的な環境下でのロバスト性を向上させる手法を提案した。
- TacVLA: 接触認識型触覚融合による堅牢な視覚言語行動操作VLA/触覚/操作2026/3/1
視覚と言語に依存するVLAモデルに触覚を統合し、接触検出時のみ触覚トークンを活性化するゲーティング機構を導入して、細かい操作や視覚遮蔽下での性能を向上させた。
- PLanAR: 計画言語に基づくエージェント推論によるロボットマニピュレーションマニピュレーション2026/2/1
VLMの推論空間を計画言語で定義し、各行動後にシンボリックな効果を検証して失敗検出と再計画を行う、長期的なオープンボキャブラリ操作のためのロボットエージェントフレームワーク。
- CompliantVLA-adaptor:VLM誘導可変インピーダンスによる安全な接触リッチマニピュレーションマニピュレーション2026/1/1
VLAモデルにVLMが解釈したタスク文脈で可変インピーダンス制御を適応させ、力覚フィードバックで安全性を確保することで、接触を伴うマニピュレーションの成功率と安全性を向上させた。
- VibeCheck: 能動的音響触覚センシングによる接触の多いマニピュレーション触覚2025/4/1
圧電フィンガーで物体に音響振動を伝え、その応答から物体の材質や接触状態を推定し、ペグ挿入タスクを模倣学習で実現した研究。