Chang Xu
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ShelfChange3D: 小売棚監視のための物体レベル3D変化検出3D変化検出2026/10/1
RGB-D観測のペアから棚の商品変化を物体レベルの3Dバウンディングボックスで検出するタスクを定式化し、大規模データセットと幾何補正を組み込んだエンドツーエンド手法を提案した。
- DSDyn-VLA:動き知覚・未来予測・リアルタイム補正を備えた二重ストリーム動的マニピュレーション枠組みVLA2026/9/30
動的環境でのVLAの知覚・遅延・制御ギャップを解決するため、遅いFlow-Plannerと速いRes-Refinerからなる二重ストリーム枠組みを提案し、動的物体操作ベンチマークDynBenchを導入した。
- 視覚中断下での行動を視覚言語行動モデルで学習するVLA2026/9/28
カメラ映像が途切れてもロボットが作業を続けられるよう、視覚言語行動モデルを訓練し、推論時にオプティカルフローや世界モデルで欠損視覚を補完する手法MINTを提案し、ベンチマークMAIL-Benchで評価した。
- Copper-Policy: ロバストなロボットマニピュレーションのための表現学習マニピュレーション2026/9/26
方針と共にコンパクトな世界表現を学習し、ピクセル再構成なしで未来の観測埋め込みを予測することで、効率的な学習と高い制御性能を両立したロボットマニピュレーション手法。
- OccamView: フレーム予算制約下のアクティブ3Dガウス再構成のためのオブジェクト条件付き視点選択3D再構成2026/8/17
限られたフレーム予算で3Dガウス再構成を行う際、物体の隠れ領域を考慮した視点選択手法を提案し、再構成の完全性を向上させた。
- StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーションVLA2026/8/1
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
- 視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察VLA/モデル圧縮2026/6/1
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
- VLA-ATTC: 相対アクション批評モデルによるVLAモデルの適応的テスト時計算VLA/意思決定2026/5/1
VLAモデルに不確実性に基づく「認知クラッチ」を導入し、複雑な状況でのみ推論フェーズへ切り替える適応的テスト時計算フレームワークを提案。相対比較で最適アクションを選ぶ批評モデルにより、LIBERO-LONGでSOTAの失敗率を50%以上削減した。
- シミュレーションからリアリズムを見る:視覚言語行動データ拡張のための効率的なビデオ変換VLA/データ拡張2026/5/1
シミュレーションで生成したVLA学習用ビデオを、タスクの意味と行動軌跡を保ちつつ現実的なビデオに変換する効率的なデータ拡張フレームワークを提案。拡散モデルの特徴再利用とコアセットサンプリングにより計算コストを抑え、実ロボットを含む複数ベンチマークで性能を向上させた。
- Sentinel-VLA: 動的推論とエラー回復のための能動的状態監視を備えたメタ認知VLAモデルVLA/ロボット操作2026/5/1
VLAモデルに能動的な状態監視モジュールを追加し、必要時のみ動的推論やエラー回復を行うメタ認知型モデルを提案。自己進化的継続学習と直交アダプタにより性能向上と破滅的忘却防止を実現し、実機で成功率を30%以上向上させた。
- 重要なものを見る:汎用視覚言語行動モデルのための微分可能グリッドサンプル刈り込みVLA/圧縮2026/5/1
視覚言語行動モデルの計算コストを削減するため、タスクに応じて視覚トークンを連続的に再サンプリングする微分可能グリッドサンプラを提案。10%未満のトークンで精度を保ちつつFLOPsを76%削減。
- SmoothTurn: 四足歩行ロボットの俊敏なナビゲーションのためのスムーズな旋回学習歩行2026/3/1
四足歩行ロボットが高速走行中に滑らかに方向転換できるよう、連続目標ナビゲーションタスクを定式化し、将来の目標を見越した観測とカリキュラム学習で制御方策を学習するフレームワークを提案。
- MobileManiBench:モバイルマニピュレーションのためのモデル検証を簡素化するベンチマークVLA2026/2/1
NVIDIA Isaac Simと強化学習を用いて、多様なモバイルマニピュレーション軌道を自動生成する大規模ベンチマークを構築し、代表的なVLAモデルの性能を評価した。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出VLA2025/12/1
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- 動作認識型動的プルーニングによる効率的なVision-Language-ActionマニピュレーションVLA2025/9/1
ロボット操作の段階に応じて視覚トークンの冗長性が異なる点に着目し、動作軌跡に基づいてトークン保持率を適応的に調整するプルーニング手法を提案。計算量と遅延を削減しつつ成功率を維持する。
- 折り紙構造で力制御を可能にしたソフトグリッパソフトグリッパ2025/3/1
折り紙に着想を得た構造で、広いひずみ範囲で調整可能な一定の把持力を実現するソフトグリッパを提案し、シミュレーションと実験で有効性を示した。
- VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーションVLA2025/2/1
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。
- UniGraspTransformer:スケーラブルな器用把持のための簡素化された方策蒸留マニピュレーション2024/12/1
物体ごとに強化学習で把持方策を訓練し、それを単一のTransformerネットワークに蒸留することで、多様な物体・姿勢に対応する汎用器用把持を実現した研究。
- 反復レンダリングによる教師なしマルチビューUAV画像のジオローカリゼーションクロスビュー位置推定2024/11/1
UAVの斜め視点画像から3D表現を構築し衛星視点画像を生成することで、ラベル付きデータなしに地域に依存しないクロスビュー位置推定を実現した研究。
- An Improved Wrist Kinematic Model for Human-Robot Interaction2020/2/1