Yuzhang Shang
UCF
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DeltaWAM: 変化中心の視覚予測による効率的なWorld-ActionモデルVLA2026/9/27
連続フレーム間の変化を表すコンパクトなdeltaトークンで未来を予測するWorld-Actionモデルを提案し、LIBEROで92.8%の成功率を達成した。
- 障害物を考慮したハーネスによる安全なロボットマニピュレーションのためのコーディングエージェントマニピュレーション2026/9/17
言語モデルがロボット制御プログラムを書くコーディングエージェントは安全制約を無視しがちなため、障害物を考慮した経路計画と接触実行のハーネスを導入し、安全性を優先させる手法を提案する。
- BATONを落とすな:エージェント的サブタスク探索と遷移認識メモリによる長期的ロボット操作マニピュレーション2026/8/17
長期的なロボット操作タスクを、VLAモデルを凍結しLLMエージェントがサブタスク単位で探索・記憶することで、コストを加算的にし、遷移条件を明示して失敗を単一ステージに帰属させる手法BATONを提案。
- 外科用WAM:データ効率的な手術ロボット学習のためのワールド・アクションモデル手術ロボット学習2026/8/11
手術ロボットの操作学習において、動作ラベル付きデモデータが不足する問題に対し、動作ラベルなしの内視鏡ビデオで事前学習する統一生成モデルを提案し、閉ループ制御で成功率を向上させた。
- C$^3$ache: クロス推論チャンクキャッシュによるワールドアクションモデルの高速化VLA/推論高速化2026/6/8
ワールドアクションモデル(WAM)の推論を高速化するため、異なる推論チャンク間で残差をキャッシュして再利用する学習不要の手法C$^3$acheを提案し、最大2.5倍の高速化を達成した。
- Aero-World: 慣性制御に基づく行動条件付き空中映像生成映像生成2026/5/19
事前学習済みの画像から映像への拡散モデルを、加速度や角速度などの慣性制御信号に従う空中映像生成器へ変換する手法を提案。実映像とIMUデータで訓練した物理プローブにより、映像の慣性整合性を監視しつつLoRAで微調整する。
- VLA-Thinker: 画像思考による視覚言語行動モデルの性能向上VLA2026/3/1
視覚入力を動的に再参照できる思考フレームワークを導入し、2段階学習でロボット操作性能を大幅に向上させた。
- マスク付きアクションチャンキングによるリアルタイムロボット実行マニピュレーション2026/1/1
非同期推論時のチャンク内不整合に対処するため、マスク付きアクションチャンキングで事前学習方策を補正し、遅延に頑健なリアルタイム実行を実現した。
- SilentDrift: アクションチャンキングを悪用したVLAモデルへのステルスバックドア攻撃VLAセキュリティ2026/1/1
VLAモデルのアクションチャンキングとデルタポーズ表現に潜む脆弱性を突き、Smootherstep関数とキーフレーム戦略で検知困難なバックドア攻撃を実現した研究。