Siyu Xu
収録論文 10本 ・ フィジカルAI/ロボット学習
VLA/操作VLAVLA/モデル圧縮VLA/データ拡張
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 凍結VLAポリシーのための達成基盤メモリによる閉ループエージェントVLA/操作2026/8/30
凍結された視覚-言語-行動(VLA)ポリシーに、物理的証拠で検証されたサブゴール進行ポインタを持つ軽量メモリを追加し、開ループ実行を閉ループ化するフレームワークを提案。
- StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーションVLA2026/8/1
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
- 視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察VLA/モデル圧縮2026/6/1
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
- シミュレーションからリアリズムを見る:視覚言語行動データ拡張のための効率的なビデオ変換VLA/データ拡張2026/5/1
シミュレーションで生成したVLA学習用ビデオを、タスクの意味と行動軌跡を保ちつつ現実的なビデオに変換する効率的なデータ拡張フレームワークを提案。拡散モデルの特徴再利用とコアセットサンプリングにより計算コストを抑え、実ロボットを含む複数ベンチマークで性能を向上させた。
- アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出VLA2025/12/1
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
- 動作認識型動的プルーニングによる効率的なVision-Language-ActionマニピュレーションVLA2025/9/1
ロボット操作の段階に応じて視覚トークンの冗長性が異なる点に着目し、動作軌跡に基づいてトークン保持率を適応的に調整するプルーニング手法を提案。計算量と遅延を削減しつつ成功率を維持する。
- VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーションVLA2025/2/1
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。
- A Self-adaptive LSAC-PID Approach based on Lyapunov Reward Shaping for Mobile Robots2021/11/1
- A Self-adaptive SAC-PID Control Approach based on Reinforcement Learning for Mobile Robots2021/3/1
- Multi-view registration of unordered range scans by fast correspondence propagation of multi-scale descriptors2018/4/1