Xu Yang
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視線プロンプト:Vision-Language-Actionファインチューニングのための時間的に密な人間の注意VLA2026/9/28
VRテレオペレーション中の視線をフレーム単位の視覚プロンプトとしてVLAモデルに与え、展開時は軽量予測器で視線を推定することで、実世界の両手マニピュレーション成功率を26.3%から56.0%に向上させた。
- ワールドモデルからワールドアクションモデルへ:次状態予測の再考VLA2026/9/28
次状態の表現をRGBや単一特徴に固定せず、視覚・意味・幾何・相互作用の複数投影を動的にサンプリングして統合学習するCF-WAMを提案し、人間とロボットの経験を共有遷移学習に活かして制御性能と汎化を向上させた。
- 固有受容覚による力推定を用いた四足歩行と人間-ロボットインタラクション歩行2026/9/28
固有受容覚の履歴から3次元力を推定し、その推定値を用いて四足ロボットの歩行制御とリーシュ誘導を統合的に行う手法を提案した。
- 物体中心条件付けによる視覚運動フローマッチングマニピュレーション2026/9/21
シーンを物体ごとの意味特徴と空間手がかりに分離し、フローマッチング方策の条件付けに用いることで、視覚的妨害や位置ずれに頑健なマニピュレーションを実現した。
- 形態パラメータ一般化のためのグラフ演算子ワールドモデルワールドモデル2026/8/21
連続制御におけるワールドモデルを、リンク長や質量などの形態パラメータが変化しても汎化できるよう、グラフ構造と演算子分解を用いて構築した。
- SparseCtrl-HOI: 人間と物体のインタラクション動画生成のためのスパース時間制御動画生成2026/7/7
人間と物体のインタラクション動画生成において、少数のキーフレームと高レベルな動作プリエントのみを用いて、物理的に妥当な遷移を生成するスパース時間制御フレームワークを提案した。
- 関係バイアスによる意味的証拠の調整を用いたゼロショット物体ナビゲーションナビゲーション2026/6/1
未知環境での物体探索において、誤解を招く意味的手がかりを動的に調整する訓練不要のフレームワークSER-Navを提案し、ナビゲーション性能を向上させた。
- KIOプランナー:UAVナビゲーションのための注意誘導型単一段モーションプランニングとデュアルマッピングUAVナビゲーション2026/5/1
壁の多い狭小環境でのUAV自律飛行向けに、注意機構とデュアルマッピングを統合した単一段の軌道計画フレームワークを提案し、安全性と滑らかさを向上させた。
- SAGA: 安全なUAV自律ナビゲーションのためのロバストな自己注意と目標認識アンカーベースプランナーナビゲーション2026/5/1
本論文は、UAVの安全な自律ナビゲーションのための新しいプランナーSAGAを提案する。深度画像と運動状態から、固定アンカー格子に対する終端状態と計画スコアを単一のフォワードパスで予測し、自己注意と極座標位置エンコーディングを用いてクロスアンカー推論を行う。
- 開ループ計画、閉ループ検証:VLAのための投機的検証VLA/操作2026/4/1
VLAモデルの高コストな推論を効率化するため、重いVLAで低頻度に行動チャンクを計画し、軽量な検証器が最新観測に基づいて実行を監視・必要時のみ再計画するフレームワークSV-VLAを提案した。
- Fly360: ドローン視点での全方位障害物回避ドローン/障害物回避2026/3/1
ドローンが進行方向と機首方向が異なる場合でも、全方位の障害物を回避できるようにするための、パノラマカメラを用いた2段階の認識・意思決定パイプラインを提案した。
- 回復して予測する:可変長軌道予測のための段階的回顧学習軌道予測2026/3/1
不完全な可変長の軌跡データから完全な軌跡を予測する問題に対し、段階的に特徴を整列させる回顧的枠組みを提案した。
- OPRIDE: データセット内探索によるオフライン選好ベース強化学習選好ベース強化学習2026/2/19
オフライン選好ベース強化学習において、クエリ効率を高めるための探索戦略と割引スケジューリングを組み合わせた手法を提案し、少ないクエリで高性能を達成した。
- DSCD-Nav: 物体ナビゲーションのための二立場協調討論ナビゲーション2026/1/1
視覚言語モデルを用いた物体ナビゲーションにおいて、タスク理解と安全・情報バランスの二つの立場から協調的に討論させ、合意形成で行動を決定する手法を提案。不確実な選択には軽量な追加確認を行うことで、探索の冗長性を減らし成功率と経路効率を改善した。
- 予測的エネルギー認識に基づく公称歩容選択による車輪付き四脚ロボットの省エネ全方向移動歩行2026/1/1
車輪付き四脚ロボットの消費電力を1秒先まで予測するネットワークを構築し、最も省エネな歩容を選んで強化学習で微調整することで、速度追従性能を保ちつつ最大35%の省エネを実現した。
- AWOISVのモデリングと制御:横位置と方位角の同時追従のためのフィルタ付きチューブベースMPCアプローチ車両制御/MPC2025/8/1
全輪独立ステアリング車両AWOISVについて、新しい操舵半径角と横滑り角表現に基づく運動モード切替を定義し、フィルタ付きチューブベースLTV-MPCで横位置と方位角の同時高精度追従を実現した。
- RAPID Hand:汎用ロボット自律性のための堅牢・低コスト・知覚統合型巧みな操作プラットフォームマニピュレーション2025/6/1
低コストで高自由度な多指ハンドと、触覚・視覚・固有感覚を統合した知覚系、高自由度テレオペレーションを共同設計し、高品質な操作データを収集できるプラットフォームを提案。
- 意味・構造制約を用いた階層的画像マッチングによるUAV絶対視覚自己位置推定絶対自己位置推定2025/6/1
GNSSが使えない環境で、UAVの視覚画像を衛星地図に階層的にマッチングさせ、意味特徴と構造制約で粗対応を取ってから画素レベルの精密対応を行う絶対位置推定手法を提案した。
- VinT-6D:視覚・触覚・固有感覚を統合した大規模物体把持データセットマニピュレーション2025/1/1
ロボットの手先操作のための、視覚・触覚・固有感覚を統合した大規模データセットVinT-6Dを構築し、シミュレーションと実環境の両方で200万件以上のデータを収集した。
- DaDu-E:ロボット計算パイプラインにおける大規模言語モデルの役割を再考するVLA2024/12/1
軽量LLMとスキル命令・フィードバック・記憶拡張を組み合わせた閉ループ計画フレームワークDaDu-Eを提案し、大規模モデル並みの成功率を6.6倍少ない計算量で実現した。
- C³P-VoxelMap: コンパクト・累積・統合可能な確率的ボクセルマッピングSLAM/マッピング2024/6/1
LiDARオドメトリ向けに、点群を保持せず統計量のみを累積更新する確率的ボクセルマップを提案し、さらに同一平面のボクセルを遅延統合することでメモリ削減と精度向上を実現した。
- MemoNav: 視覚ナビゲーションのための作業記憶モデル視覚ナビゲーション2024/2/1
画像ゴールナビゲーションにおいて、短期・長期・作業記憶を組み合わせてゴールに関連するシーン特徴を効率的に抽出する新しい記憶モデルを提案し、複数の難易度で従来手法を上回る性能を示した。
- Unseen Object Instance Segmentation with Fully Test-time RGB-D Embeddings Adaptation2022/4/1
- A Hierarchical Control Framework for Drift Maneuvering of Autonomous Vehicles2021/9/1