Xidong Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
データ収集/身体化AIVLA触覚/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- 3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与するVLA2026/6/3
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
- UniTacVLA: 視覚言語行動モデルにおける統合触覚理解と予測触覚/操作2026/6/1
接触を伴う器用な操作のために、触覚信号を動的な相互作用の手がかりとして扱い、現在の触覚状態と将来の接触変化を統合的にモデル化するフレームワークを提案。触覚連鎖思考と粗密な将来触覚予測により状態・動態を考慮した事前知識を構築し、実時間と予測触覚を組み合わせた混合制御で高精度な操作を実現。
- FocusVLA: 視覚言語行動モデルにおける視覚情報の焦点化VLA2026/3/1
VLAモデルの性能が視覚表現の質ではなく視覚情報の活用方法に制限されることを示し、注意をタスク関連領域に集中させるFocusVLAを提案した。