Dingkang Yang
Fudan University
収録論文 5本 ・ フィジカルAI/ロボット学習
移動操作3D生成VLA/攻撃/転移性セグメンテーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:混合ストリーム世界行動モデルと操作アンカーポーズ監督による統合移動操作移動操作2026/9/30
移動と操作を別々の行動エンコーダと出力ヘッドで扱う統合世界行動モデルUniWAMを提案し、大規模3Dシーンから自動生成した操作アンカーポーズ監督データで学習することで、移動操作タスクの精度を大幅に向上させた。
- Fysiverse-3D-Vision: 画像から実行可能な3D世界を生成する統合空間推論フレームワーク3D生成2026/9/22
単一画像から物体の意味・形状・配置を統合的に推論し、物理シミュレーション可能な3Dシーンを生成する視覚言語幾何フレームワークを提案。
- VLA-Hijack: 視覚的プロプリオセプション乗っ取りによる視覚言語行動モデルへの転移可能なパッチ攻撃VLA/攻撃/転移性2026/5/27
VLAモデルが動作計画前にロボットアームの自己位置を視覚で特定する共通の脆弱性を突き、注意誘導型プロプリオセプション抑制とマルチモーダル注入によりパッチを偽の身体として埋め込む転移可能な攻撃手法を提案した。
- 画像条件付きインスタンスプロンプトネットワークによる参照リモートセンシング画像セグメンテーションセグメンテーション2026/5/23
リモートセンシング画像の参照セグメンテーションにおいて、画像条件付きインスタンスプロンプトと双方向情報融合を導入し、クロスモーダル特徴融合のボトルネックを解消する新しいネットワークを提案した。
- ProFocus: 視覚と言語によるナビゲーションにおける能動的知覚と焦点化推論VLA2026/3/1
VLNエージェントの非効率な視覚処理と無差別な履歴利用を改善するため、LLMとVLMの協調による訓練不要のフレームワークProFocusを提案。能動的知覚で必要な視覚情報を特定し、BD-MCTSで高価値な経路点に焦点を当てた推論を行う。