Yi Xu
Midea Group
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ARS: ロボット学習のためのエージェント型報酬システム報酬モデリング2026/9/28
汎用VLMを推論に用いて、追加学習なしにロボット軌跡の進捗報酬を推定するエージェント型フレームワークを提案し、実機の長期タスク学習で有効性を示した。
- MaskHarness-WAM: インスタンス接地型ハーネスによる長期的ロボットマニピュレーションマニピュレーション2026/9/17
外観が同じ複数物体を順番に操作する長期的タスクのため、サブタスク境界で対象マスクを再生成・検証し、高レベル計画と低レベル方策を繋ぐハーネスを提案。実機実験で有効性を示した。
- CSWAM: 世界行動モデルの分布外汎化のための因果意味表現の改善VLA2026/9/16
V-JEPA 2.1をベースにした因果意味エキスパートをFastWAMに追加し、見たことのない環境や物体でもロボット行動を汎化させる手法を提案。
- FolDeX: 変形可能物体の長期的ロボット操作のための実世界ベンチマーク変形物体操作2026/9/9
衣類折りたたみを主タスクとし、2000時間以上の実ロボットデータと10種以上の機体を用いて、変形物体の長期的な両手操作を評価する実世界ベンチマークを構築した。
- GlanceWAM: 世界行動モデルのためのスパースなテスト時想像VLA2026/8/25
ビデオ生成モデルの物理的知識をロボット学習に活用しつつ、制御レートでの同期生成の遅延問題を回避するため、非同期に未来フレームを想像し、潜在空間で直接行動を生成する手法を提案。RoboCasaやLIBEROで高い成功率と高速推論を実現。
- DSWAM: 細粒度ロボット操作のための二重システム世界行動基盤モデル操作2026/7/1
粗い指示を細かいサブタスクに分解する言語プランナーと、物理的実行に優れた世界行動モデルを組み合わせた、ロボット操作のための二重システム基盤モデルを提案した。
- エンドツーエンド自動運転におけるポストトレーニング自動運転2026/7/1
エンドツーエンド自動運転モデルの模倣学習後のポストトレーニング手法を、監督信号の種類に基づいて4つのファミリーに分類し、各手法の能力・限界・課題を体系的に整理したサーベイ論文。
- 推論効率の高いワールドアクションモデルのための4次元幾何学事前知識の学習操作学習2026/7/1
ロボット操作のためのワールドアクションモデルに、動作に関連する4次元幾何学情報を注入し、推論コストを増やさずに操作性能を向上させる手法を提案した。
- PiL-World: VLAポリシーをループ内評価するためのチャンク単位ワールドモデルVLA2026/6/1
実ロボットの閉ループ評価を可能にするため、VLAポリシーのアクションチャンクに応じて将来の観測を生成するチャンク単位のワールドモデルを提案した。
- DeMaVLA: 汎用変形物操作のための視覚言語行動基盤モデルVLA/変形物操作2026/5/1
変形物(衣類など)の折りたたみを多様な物体・環境で行える視覚言語行動基盤モデルを提案し、実ロボットデモと人間介入データで訓練して汎用性を実証した。
- マルチビュー軌道動画による高整合な身体性世界モデル身体性世界モデル2025/11/1
低レベル行動をカメラパラメータとカルテシアン変換でマルチビューの軌道動画に変換し、それを制御信号として未来フレームを予測する身体性世界モデルMTV-Worldを提案。マルチビューで空間情報の損失を補い、物理世界との整合性を高めた。
- HumanoidExo: ウェアラブル外骨格によるスケーラブルな全身ヒューマノイド操作全身マニピュレーション2025/10/1
人間の動作をウェアラブル外骨格で計測し、全身ヒューマノイドの操作データへ変換するシステムを提案。実機データを補完し、少ない実演で複雑な全身制御や歩行スキル獲得を可能にした。
- ActiveUMI: ロボット不要の人間デモンストレーションによる能動的知覚を伴うロボットマニピュレーションマニピュレーション2025/10/1
VRテレオペレーションキットとセンサ付きコントローラで人間の両手作業デモを収集し、頭部運動による能動的知覚も学習してロボットに転移するデータ収集フレームワークを提案。6つの両手タスクで平均70%の成功率を達成。
- 高密度交通と多様なエージェント相互作用シナリオのための軌道生成器軌道生成2025/10/1
道路環境をグリッド表現し、ルールベースの意思決定とFrenet軌道平滑化を組み合わせて、高密度で多様な相互作用を含む現実的な走行軌道を生成するフレームワークを提案。
- dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデルVLA2025/9/1
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。
- 視界外エージェントのマルチモーダル追跡・センサ融合・軌道予測軌道予測2025/9/1
カメラに映らない物体のノイズを含むセンサ観測から、視覚的位置合わせでノイズ除去し軌道を予測する手法を歩行者から車両にも拡張し、自律走行やロボティクスへの応用可能性を高めた。
- スナップ・セグメント・デプロイ:ウェアラブル産業アシスタントのための視覚データと検出パイプライン産業支援/オンデバイスVLM2025/7/1
オンデバイスで動作する軽量物体検出・音声認識・RAGを統合した産業アシスタントを提案し、ドメインシフトに強い二段階学習とGear8データセットで有効性を示した。
- 探索しながら理解する:意味論駆動型アクティブマッピングアクティブマッピング2025/6/1
3Dガウシアンスプラッティングを基盤に、意味論的・幾何学的不確かさを定量化して次に見るべき視点を選び、未知環境の意味地図を効率的に構築する能動的マッピング手法を提案。
- ChatVLA-2: 事前学習知識を活かしたオープンワールド身体推論を備える視覚-言語-行動モデルVLA2025/5/1
VLMの能力を保持しつつロボット行動に変換するMoE型VLAモデルを提案し、ホワイトボードの数式を読んでカードを選ぶ課題などで数学・OCR・空間推論能力を示した。
- WorldEval: 世界モデルを実世界ロボット方策の評価器として活用世界モデル2025/5/1
世界モデルを実世界ロボット方策の評価代理として用いるWorldEvalを提案し、Policy2Vecで行動追従動画を生成して方策ランキングや安全性検出を実現した。
- ActiveGAMER: 効率的レンダリングによる能動的ガウシアンマッピング能動的マッピング2025/1/1
3Dガウシアンスプラッティングの高速レンダリングを活用し、情報利得に基づく次善視点計画で未知環境を自律探索しながら高精度に地図構築するシステム。
- 跳躍ロボットの回転問題を抑制する機構のモデリングとシミュレーション跳躍ロボット2024/5/1
微小ロボットの安定した跳躍のため、跳躍時に開閉する弾性受動関節(EPJ)を設計し、動力学モデリングとMATLABシミュレーションで回転を抑え跳躍距離を伸ばす効果を検証した論文。
- OOSTraj: 視界外物体の軌跡予測と視覚・測位ノイズ除去軌跡予測2024/4/1
カメラに映らない物体のノイズを含むセンサ軌跡を教師なしで除去し、視覚軌跡へと変換することで視界外の歩行者軌跡を予測する手法を提案。
- Stereo-NEC: 法線エピポーラ制約によるステレオ視覚慣性SLAM初期化の高精度化SLAM2024/3/1
ジャイロバイアスを独立推定して回転を高精度化し、法線エピポーラ制約の残差で初期化成功を判定するステレオ視覚慣性SLAMの初期化手法を提案。ORB-SLAM3を精度・ロバスト性で上回る。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- NARUTO: 不確実な目標観測に基づくニューラル能動再構成能動再構成2024/2/1
不確実性学習を組み込んだニューラル表現により、環境を自律探索しながら高精度に表面再構成するシステムを提案。
- Supported Trust Region Optimization for Offline Reinforcement Learning2023/11/15
- Layout Sequence Prediction From Noisy Mobile Modality2023/10/1
- ActiveRMAP: Radiance Field for Active Mapping And Planning2022/11/1
- CNN-Augmented Visual-Inertial SLAM with Planar Constraints2022/5/1