Yuan Xu
Chinese Academy of Sciences
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LM-X: 進捗・イベント・不確実性予測による説明可能な汎用ロボット操作の行動モデリングVLA2026/8/26
汎用VLAポリシーに、タスク進捗・イベント遷移・局所信頼性を明示的に予測する3つの信号を導入し、制御に内在する説明可能性を実現した。大規模事前学習と実ロボットデータで高い成功率を達成した。
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- BrainWAM: 自動運転のための意味的先行知識と予測ダイナミクスの行動空間協調自動運転2026/8/1
自動運転の計画において、意味的推論(VLA)と予測的ダイナミクス(WAM)を単純に結合すると注意配分の不一致が生じる問題を解決するため、行動空間で両者を協調させるBrainWAMを提案し、NAVSIMで最高性能を達成した。
- ロボット行動表現のための意味的アンカリングVLA2026/7/1
VLAモデルの微調整で失われる意味構造を保つため、行動表現を意味多様体に固定するプラグアンドプレイ手法を提案し、実世界で最大+18.7%の成功率向上を達成した。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- DiM-WAM: 多様な履歴イベントメモリを用いた世界行動モデリングVLA2026/6/1
長期依存タスク向けに、多スケールの履歴コンテキストとタスク進捗を統合したメモリ拡張型世界行動モデルを提案し、ロボット操作の成功率を大幅に向上させた。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- 構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善VLA2026/6/1
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
- 車輪付き二足ロボットの跳躍における高さ制御と最適トルク計画跳躍制御2026/5/1
車輪付き二足ロボットの跳躍高さを正確に制御するため、新しい動的モデルとベイズ最適化によるトルク計画手法を提案し、高さ誤差とエネルギー消費を大幅に削減した。
- GazeVLA: ロボット操作のための人間の意図を学習するVLA2026/4/1
人間の視線を意図の代理として学習し、ロボット操作に転移するフレームワークを提案。大規模な人間データで事前学習し、少量のロボットデータで微調整することで、長期的・細かいタスクで高性能を達成。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- Adaptor: 少数ショット学習とオペレータ横断汎化による支援遠隔操作の高度化遠隔操作2026/4/1
支援遠隔操作におけるオペレータ間の意図認識のばらつきを、ノイズ注入による軌道摂動と幾何学的キーフレーム抽出、および視覚言語モデルとの融合を用いた少数ショット学習フレームワークで解決する。
- 大規模言語モデル時代の人間-ロボット相互作用研究の動向:系統的レビューHRI2026/2/1
PRISMAガイドラインに沿った系統的文献検索で86件の論文を分析し、LLMがHRIの文脈理解・社会的相互作用・継続的適応をどう変えているか、また研究手法や評価指標の課題を整理したレビュー。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化VLA2025/11/1
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- APR-Transformer:絶対姿勢回帰による複雑環境での位置推定のための初期姿勢推定位置推定2025/5/1
画像やLiDARデータから絶対姿勢(3D位置と3D姿勢)を予測するTransformerベースのモデルを提案し、GNSS拒否環境でのロボット位置推定の初期化精度を向上させた。
- 拡散プランナーにおける人間の嗜好に合わせた潜在埋め込み適応拡散プランナー2025/3/1
事前学習済み拡散モデルに嗜好潜在埋め込みを導入し、嗜好逆転法で個々のユーザー嗜好に迅速に適応させる手法を提案した。
- マッサージ技法のデジタルモデリングとロボットアームによる再現マニピュレーション2024/12/1
中国伝統医学のマッサージ技法を運動学・動力学の観点から解析し、適応アドミタンス制御を用いたロボットアームでその力と位置を再現した研究。
- Avalon: Building an Operating System for Robotcenter2018/5/1