Wenqiang Zhang
Fudan University
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- トークン重要度を超えて:効率的な視覚-言語-行動推論のための空間スキャフォールドの保持VLA2026/9/29
視覚トークンの空間的な広がりを保つことで、視覚-言語-行動モデルの推論を高速化する訓練不要のトークン枝刈り手法を提案。
- FolDeX: 変形可能物体の長期的ロボット操作のための実世界ベンチマーク変形物体操作2026/9/9
衣類折りたたみを主タスクとし、2000時間以上の実ロボットデータと10種以上の機体を用いて、変形物体の長期的な両手操作を評価する実世界ベンチマークを構築した。
- ロボット操作のための軌道レベル連続行動表現マニピュレーション2026/8/25
制御周波数に依存せず、固定時間間隔の行動軌跡を連続潜在トークンで表現する新しい行動表現フレームワークCATを提案し、LIBEROや実機の長期的操作タスクで既存手法より高い成功率を達成した。
- QuantWAMs: ワールドアクションモデルにおける適切な粒度でのキャリブレーション量子化/モデル圧縮2026/7/30
ワールドアクションモデル(WAM)向けに、モデル構造・展開分布・タスク目的に合わせた量子化キャリブレーション手法を提案し、メモリ削減と精度維持を実現した。
- 接触を伴うロボット操作のための表現整合型触覚グラウンディング触覚/VLA/操作2026/7/1
触覚強化型VLAポリシーにおいて、将来の触覚状態を予測する中間表現の位置を特定し、軽量な潜在触覚予測器(LTP)を導入して行動表現と接触結果を整合させる手法を提案した。実機の接触を伴う操作タスクで有効性を実証した。
- EDAR: ロボット操作のための環境依存行動表現の学習マニピュレーション2026/7/1
ロボット操作において、行動トークンを実行可能な制御構造と環境条件付きの視覚的結果に基づいて表現する手法を提案し、長期的な操作タスクでのポリシー学習を改善した。
- VLA-Hijack: 視覚的プロプリオセプション乗っ取りによる視覚言語行動モデルへの転移可能なパッチ攻撃VLA/攻撃/転移性2026/5/27
VLAモデルが動作計画前にロボットアームの自己位置を視覚で特定する共通の脆弱性を突き、注意誘導型プロプリオセプション抑制とマルチモーダル注入によりパッチを偽の身体として埋め込む転移可能な攻撃手法を提案した。
- LongBench: 実世界の長時間ホライズンタスクにおけるロボット操作ポリシーの評価操作/ベンチマーク2026/4/1
実世界の長時間操作タスクを評価するベンチマークLongBenchを提案し、実行堅牢性と文脈依存推論の要因を分離して分析した。
- ロボットマニピュレーションのための高速視覚運動ポリシーマニピュレーション2025/10/1
エネルギーMLPを用いて単一順伝播でマルチモーダル行動を予測し、高頻度・低リソース環境で高精度な操作を実現するEnergy Policyを提案した。
- 複雑な産業環境における異常検知のためのノイズ融合蒸留学習異常検知2025/6/1
産業環境での異常検知・位置特定のため、異種教師ネットワークと適応的局所大域特徴融合、局所多変量ガウスノイズ生成を組み合わせた蒸留学習フレームワークを提案し、複雑な条件下での精度とロバスト性を向上させた。
- ForceVLA:力覚対応MoEで接触の多いマニピュレーションを強化するVLAモデルマニピュレーション2025/5/1
外部力覚をVLAの第一級モダリティとして扱い、力覚対応のMixture-of-Experts融合モジュールで視覚言語埋め込みと6軸力フィードバックを統合する操作フレームワークを提案し、接触の多いタスクの成功率を23.2%向上させた。