Chenghao Xia
収録論文 4本 ・ フィジカルAI/ロボット学習
VLAVLA/圧縮
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーションVLA2026/8/1
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
- 重要なものを見る:汎用視覚言語行動モデルのための微分可能グリッドサンプル刈り込みVLA/圧縮2026/5/1
視覚言語行動モデルの計算コストを削減するため、タスクに応じて視覚トークンを連続的に再サンプリングする微分可能グリッドサンプラを提案。10%未満のトークンで精度を保ちつつFLOPsを76%削減。
- アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出VLA2025/12/1
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
- VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーションVLA2025/2/1
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。