Xiangyang Xue
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WeaveLA: 反復ロボット操作のためのイベント駆動型サブタスク間潜在記憶の織り込みVLA/操作2026/6/16
VLAポリシーに、サブタスク完了イベントで圧縮した潜在記憶を次のサブタスクの行動生成に渡す軽量なクロスサブタスク記憶チャネルを追加し、反復操作の成功率を向上させた。
- Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニングVLA2026/5/1
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
- OFlow: 物体認識を組み込んだ時間的フローマッチングによる堅牢なロボット操作VLA/操作2026/4/1
ロボット操作のためのVLAモデルに、物体認識を組み込んだ時間的フローマッチングを導入し、将来予測と物体認識を統一した潜在空間で行うことで、分布シフト下での堅牢性を向上させた。
- DINO-VO: 注目すべき場所を学習し、状態推定を強化する視覚オドメトリ2026/4/1
DINO-VOは、適応的なパッチ選択機構を組み込んだエンドツーエンドの単眼視覚オドメトリシステムで、シーン一般化性能を向上させ、多様な環境での追跡精度を達成した。
- OCRA: 3Dと触覚の事前知識を用いた物体中心学習による人間からロボットへの行動転移模倣学習/行動転移2026/3/1
人間のデモ動画からロボットの操作行動を学習する物体中心フレームワークOCRAを提案。3D点群と触覚情報を統合し、拡散ポリシーでロバストな操作を実現する。
- PoseVLA: 汎用ポーズ事前学習による汎化可能な視覚-言語-行動ポリシーVLA2026/2/1
VLAモデルの特徴崩壊と学習効率の低さを解決するため、カメラ中心の統一空間で3D空間事前知識を抽出する事前学習と、ロボット固有の行動空間への適応を行う事後学習に分離したPose-VLAを提案。離散ポーズトークンにより多様な3Dデータと軌道データを統合し、RoboTwin 2.0で79.5%、LIBEROで96.0%の成功率を達成。
- ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3DロボットマニピュレーションVLA2026/1/1
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
- TP-MDDN: タスク優先度付きマルチ要求駆動ナビゲーションと自律的意思決定ナビゲーション2025/11/1
複数の要求とタスク優先度を考慮した長期的ナビゲーションの新ベンチマークTP-MDDNを提案し、指示分解・目標選択・タスク監視を行う自律意思決定システムAWMSystemで解決する。
- SCOOP'D: Sim2Real生成ポリシーによる混合液固形物のすくい取り学習sim2real2025/10/1
OmniGibsonシミュレータで特権情報を用いたすくい取りデモを収集し、拡散モデルによる生成ポリシーで観測入力から模倣学習することで、実世界でのゼロショットすくい取りを実現した。
- LLM駆動の空間推論によるオープンボキャブラリ3D視覚グラウンディングのためのニューラル表現フレームワーク3D視覚グラウンディング2025/7/1
大規模言語モデルで言語クエリの空間関係を推論し、視覚特性を強化した階層的特徴場を構築することで、自由記述の指示から3D空間内の対象物体を高精度に特定する手法を提案。
- 時空間認識を組み込んだ視覚運動拡散ポリシー学習VLA2025/7/1
動的ガウス世界モデルを用いて3D空間・4D時空間認識を拡散ポリシーに組み込み、シミュレーションと実機で成功率を向上させた視覚模倣学習手法。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
- 一度だけ推定:ロボット把持のための統合・ワンステージ・リアルタイムカテゴリレベル関節物体6D姿勢推定6D姿勢推定2025/6/1
関節物体のカテゴリレベル6D姿勢推定を、インスタンス分割とNPCS表現を同時に出力する単一ステージのネットワークで実現し、200Hzのリアルタイム動作を可能にした研究。
- Hi-Dyna Graph: 人間中心環境におけるロボット自律性のための階層的動的シーングラフシーングラフ2025/6/1
永続的なグローバル配置と局所的な動的意味情報を統合した階層的動的シーングラフを構築し、LLMエージェントによるタスク推論と指示生成で人間中心環境でのロボット自律動作を実現する。
- LOG-Nav: 階層的計画による効率的なレイアウト認識物体ゴールナビゲーションナビゲーション2025/5/1
LLMエージェントが大域トポロジカルマップと局所シーン記憶を階層的に使うことで、複数部屋の屋内環境で高精度かつ効率的に物体ゴールへナビゲートする手法を提案し、実機でも検証した。
- CAP-Net: 単一RGB-D画像からカテゴリ別関節部品の6D姿勢とサイズを推定する統合ネットワーク6D姿勢推定2025/4/1
RGB-D特徴を統合した単段ネットワークで、関節物体の各部品の6D姿勢とサイズをカテゴリレベルで推定する手法を提案し、sim-to-realギャップを埋める大規模データセットRGBD-Artも構築した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- LAC-Net: 遮蔽下での高精度ロボット把持のための線形融合注意誘導畳み込みネットワークマニピュレーション2024/8/1
RGBと深度を線形融合する注意誘導型ネットワークで物体の遮蔽部分を補完し、雑然とした環境でのロボット把持精度を向上させた研究。
- Topo-Field: 脳に着想を得た階層的レイアウト・物体・位置場によるトポメトリックマッピングSLAM/マッピング2024/6/1
脳の後嗅皮質の仕組みに着想を得て、レイアウト・物体・位置の関連をニューラル場に統合し、意味的豊かさと計算効率を両立したトポメトリック地図を構築するフレームワークを提案した。
- FastOcc: 2D鳥瞰図と透視図の融合による3D占有予測の高速化3D占有予測2024/3/1
自動運転向け3D占有予測において、計算コストの高い3D畳み込みを軽量な2D BEV畳み込みと画像特徴の補間で置き換え、精度を保ちつつ推論を高速化した手法を提案。
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1
- PourIt!: Weakly-supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic Pouring2023/7/1
- SUPS: A Simulated Underground Parking Scenario Dataset for Autonomous Driving2023/2/1
- Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions2022/5/1
- I Know What You Draw: Learning Grasp Detection Conditioned on a Few Freehand Sketches2022/5/1
- SAR-Net: Shape Alignment and Recovery Network for Category-level 6D Object Pose and Size Estimation2021/6/1
- 3DCFS: Fast and Robust Joint 3D Semantic-Instance Segmentation via Coupled Feature Selection2020/3/1