Xiangnan Wu
Institute of Automation, Chinese Academy of Sciences
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメントVLA2025/6/1
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。