Yunke Wang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ShelfChange3D: 小売棚監視のための物体レベル3D変化検出3D変化検出2026/10/1
RGB-D観測のペアから棚の商品変化を物体レベルの3Dバウンディングボックスで検出するタスクを定式化し、大規模データセットと幾何補正を組み込んだエンドツーエンド手法を提案した。
- 視覚中断下での行動を視覚言語行動モデルで学習するVLA2026/9/28
カメラ映像が途切れてもロボットが作業を続けられるよう、視覚言語行動モデルを訓練し、推論時にオプティカルフローや世界モデルで欠損視覚を補完する手法MINTを提案し、ベンチマークMAIL-Benchで評価した。
- OccamView: フレーム予算制約下のアクティブ3Dガウス再構成のためのオブジェクト条件付き視点選択3D再構成2026/8/17
限られたフレーム予算で3Dガウス再構成を行う際、物体の隠れ領域を考慮した視点選択手法を提案し、再構成の完全性を向上させた。
- StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーションVLA2026/8/1
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
- シミュレーションからリアリズムを見る:視覚言語行動データ拡張のための効率的なビデオ変換VLA/データ拡張2026/5/1
シミュレーションで生成したVLA学習用ビデオを、タスクの意味と行動軌跡を保ちつつ現実的なビデオに変換する効率的なデータ拡張フレームワークを提案。拡散モデルの特徴再利用とコアセットサンプリングにより計算コストを抑え、実ロボットを含む複数ベンチマークで性能を向上させた。
- 重要なものを見る:汎用視覚言語行動モデルのための微分可能グリッドサンプル刈り込みVLA/圧縮2026/5/1
視覚言語行動モデルの計算コストを削減するため、タスクに応じて視覚トークンを連続的に再サンプリングする微分可能グリッドサンプラを提案。10%未満のトークンで精度を保ちつつFLOPsを76%削減。
- SmoothTurn: 四足歩行ロボットの俊敏なナビゲーションのためのスムーズな旋回学習歩行2026/3/1
四足歩行ロボットが高速走行中に滑らかに方向転換できるよう、連続目標ナビゲーションタスクを定式化し、将来の目標を見越した観測とカリキュラム学習で制御方策を学習するフレームワークを提案。
- アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出VLA2025/12/1
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
- 動作認識型動的プルーニングによる効率的なVision-Language-ActionマニピュレーションVLA2025/9/1
ロボット操作の段階に応じて視覚トークンの冗長性が異なる点に着目し、動作軌跡に基づいてトークン保持率を適応的に調整するプルーニング手法を提案。計算量と遅延を削減しつつ成功率を維持する。
- VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーションVLA2025/2/1
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。