Xiaodan Liang
収録論文 36本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- PAVXploreRL: 行動探索を伴う物理・行動・視覚の世界モデル強化学習世界モデル/強化学習2026/7/18
事前学習済みの潜在世界モデルに強化学習を適用し、物理的妥当性・行動追従性・視覚的忠実性を明示的に最適化することで、専門家データ外の行動への汎化を改善する手法を提案した。
- PhysEditWorld: 物理編集可能なワールドモデル向け大規模データセットデータセット2026/6/25
ゲームワールドモデルの物理ダイナミクスを制御可能にするため、重力パラメータを明示的に付与した大規模マルチモーダルデータセットを構築した。
- STEAM: 実世界ロボット学習のための自己教師あり時間アンサンブル優位性モデリングロボット学習2026/6/1
専門家のデモからフレーム間の時間オフセットを自己教師ありで学習し、ロールアウトデータの各フレームの優位性を評価する手法を提案。混合品質データの保守的なスコアリングにより、ポリシー学習の成功率を向上させた。
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- 観察対象の選択:視覚運動ポリシーのためのタスク認識型意味幾何表現視覚運動ポリシー2026/3/1
RGB画像とタスク関連エンティティの指定から、対象物とロボットをセグメント化し、意味色と深度情報を統合した標準的な3チャンネル画像表現を構築する観察インターフェースを提案。外観変化に対するロバスト性を向上させる。
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- AtomicVLA: ロボットにおける原子スキル学習の可能性を解き放つVLA/操作/継続学習2026/3/1
長期的・多段階のロボット操作タスクを扱うため、タスク計画・原子スキル抽象化・細粒度アクションを統合的に生成するフレームワークAtomicVLAを提案。スキル誘導型Mixture-of-Expertsによりスケーラブルな原子スキルライブラリを構築し、継続学習も可能にした。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- ArtiSG: 人間の実演による関節物体操作を用いた機能的3Dシーングラフ構築シーングラフ2025/12/1
人間の操作実演から6自由度軌跡と関節軸を推定し、開語彙の階層的3Dシーングラフに組み込むことで、隠れた取っ手などの機能要素も発見できるロボット記憶を構築するフレームワーク。
- GLaD: 視覚言語行動モデルのための幾何潜在蒸留VLA2025/12/1
3D幾何情報を知識蒸留でVLAモデルに組み込み、深度センサーや3D注釈なしで空間推論と操作性能を向上させた手法。
- EchoVLA: 宣言的記憶を統合した移動マニピュレーション向け視覚-言語-行動モデルVLA2025/11/1
人間の脳に着想を得たシーン記憶とエピソード記憶を組み合わせ、移動と操作を協調させるメモリ対応VLAモデルを提案し、大規模学習用ベンチマークMoManiも構築した。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- RoboPearls: ロボットマニピュレーションのための編集可能なビデオシミュレーションsim2real2025/6/1
3Dガウススプラッティングを用いて実演ビデオからフォトリアルなシミュレーションを構築し、LLMで自動化された編集操作を可能にするロボットマニピュレーション向けフレームワークを提案。
- PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマークベンチマーク/VLA2025/6/1
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
- RoBridge:汎用ロボット操作のための認知と実行を橋渡しする階層型アーキテクチャマニピュレーション2025/5/1
大規模視覚言語モデルによる高レベル認知プランナと強化学習による汎用身体エージェントを、不変操作表現を介して階層的に統合し、認知と実行のギャップを埋めるロボット操作手法を提案。
- A0: 汎用ロボットマニピュレーションのためのアフォーダンス認識階層モデルマニピュレーション2025/4/1
物体との接触点と接触後軌道を予測するアフォーダンス表現を用い、高レベルな空間理解と低レベル行動実行を階層的に分けた拡散モデルを提案。複数ロボットで汎用性と実世界性能を示した。
- 見えざるものを見えるものから:基盤モデルによる観察・指示の書き換えで視覚言語ナビゲーションを拡張VLA2025/3/1
視覚言語ナビゲーションのデータ不足を解消するため、基盤モデルで訓練データの観察と指示を書き換えて新たなペアを生成し、未知環境への汎化を促す手法を提案。
- RoboTron-Drive:自動運転のためのオールインワン大規模マルチモーダルモデルVLA2024/12/1
画像や多視点動画を入力とし、知覚・予測・計画を含む多様な自動運転タスクを単一モデルで実行する汎用大規模マルチモーダルモデルを提案し、複数ベンチマークで最先端性能を達成した。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。
- InfiniteWorld: 汎用視覚言語ロボットインタラクションのための統合スケーラブルシミュレーションフレームワークsim2real2024/12/1
Nvidia Isaac Sim上に構築された、汎用視覚言語ロボットインタラクション向けの統合スケーラブルなシミュレータを提案し、3Dアセット構築やReal2Sim、自動注釈などの機能と4つの新しいベンチマークを提供する。
- VidMan: ビデオ拡散モデルの暗黙的ダイナミクスを活用したロボットマニピュレーションマニピュレーション2024/11/1
ビデオ拡散モデルを2段階で訓練し、未来の視覚軌道予測で環境ダイナミクスを学習した後、逆ダイナミクスモデルに変換してロボット操作の行動予測精度を向上させた研究。
- InstruGen: 大規模マルチモーダルモデルによる視覚言語ナビゲーション向け指示文の自動生成VLA2024/11/1
YouTubeの住宅ツアー動画を実環境に近いナビゲーション場面として使い、大規模マルチモーダルモデルで多様で高品質な経路と指示文のペアを自動生成する手法を提案し、未見環境での性能を向上させた。
- PIVOT-R: プリミティブ駆動型ウェイポイント認識ワールドモデルによるロボットマニピュレーションマニピュレーション2024/10/1
言語指示に基づくロボット操作のため、プリミティブ動作の解析とウェイポイント予測を行うワールドモデルを提案し、非同期階層実行により効率を大幅に向上させた。
- すべてのロボットを一つに:多用途な汎用身体性エージェントのための新標準と統合データセットデータセット2024/8/1
実世界とシミュレーションのデータを統合した新標準ARIOを提案し、約300万エピソード・32万タスクからなる大規模データセットを構築した。
- 基盤モデルを用いたアフォーダンス指向の連続視覚言語ナビゲーション計画VLA2024/7/1
SAMで地面のアフォーダンスを抽出し、LLMが経由点と経路をゼロショットで計画する連続VLN手法AO-Plannerを提案し、R2R-CEとRxR-CEで最高精度を達成した。
- サイバー空間と物理世界の融合:Embodied AIに関する包括的サーベイEmbodied AI2024/7/1
Embodied AIの最新動向を、ロボット・シミュレータ、知覚・相互作用・エージェント・sim-to-realの4研究領域、マルチモーダル大規模モデルの活用まで網羅的に整理したサーベイ論文。
- 摂動を考慮した対照学習による逸脱に頑健なエージェントナビゲーションVLA2024/3/1
視覚と言語によるナビゲーション(VLN)エージェントが、障害物や人間の妨害などによる経路逸脱に対して頑健になるよう、経路摂動と対照学習を組み合わせた学習パラダイムPROPERを提案した。
- NavCoT:分離推論の学習によるLLMベース視覚言語ナビゲーションの強化VLA2024/3/1
視覚言語ナビゲーション(VLN)において、LLMにナビゲーションの思考連鎖(世界モデルによる次観測の想像、候補選択、行動決定)を学習させ、ドメインギャップを効率的に埋める手法を提案。
- MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation2024/1/1
- Surfer: Progressive Reasoning with World Models for Robotic Manipulation2023/6/1
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving2022/3/1
- Deep Learning for Embodied Vision Navigation: A Survey2021/8/1
- Continuous Transition: Improving Sample Efficiency for Continuous Control Problems via MixUp2020/11/1
- CIRL: Controllable Imitative Reinforcement Learning for Vision-based Self-driving2018/7/1