Dongmei Jiang
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA動作予測セキュリティ/VLA両腕操作/エネルギーに基づくモデル/ポリシー転移視覚的位置認識
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- インラインメモリと再利用可能スキルの融合:視覚-言語-行動モデルのためのメモリ中心フレームワークVLA2026/9/30
VLAモデルに学習可能なメモリトークンを挿入し、クエリ-スキルメモリバンクでスキルを外部化することで、パラメータ更新を抑えつつ新タスクへの適応と破滅的忘却の緩和を実現した。
- どこからどのようにへ:自己中心視点ビデオからの連続4Dインタラクション予測動作予測2026/9/8
自己中心視点ビデオから将来の3Dインタラクション位置と全身動作を連続的に予測する手法を提案し、大規模データセットと評価指標も導入した。
- TrapVLA: 設定された失敗モードへのVLAモデルのトラッピングセキュリティ/VLA2026/8/27
視覚言語行動モデルに対するバックドア攻撃の新タスクを提案し、テキストトリガーで特定の失敗パターンを誘発する手法を開発した。
- EnergyAction: エネルギーに基づくモデルによる片腕から両腕への動作合成両腕操作/エネルギーに基づくモデル/ポリシー転移2026/3/1
本論文では、片腕操作ポリシーをエネルギーに基づくモデルとして表現し、その合成特性を利用して両腕操作タスクへ転移するフレームワークを提案する。時間的・空間的な協調メカニズムと適応的ノイズ除去戦略を導入し、高品質な両腕動作を効率的に生成する。
- グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーションVLA2026/2/1
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
- CricaVPR: 画像間相関を考慮した視覚的位置認識のための表現学習視覚的位置認識2024/2/1
バッチ内の複数画像の相関を注意機構で捉え、視点や照明の変化に頑健な位置認識用のグローバル表現を学習する手法を提案。