Hang Xu
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- Map2Route: 意味地図上の構成的言語指示に基づく経路計画ベンチマーク経路計画2026/9/15
意味地図上で複雑な言語指示から経路を計画するベンチマークMap2Routeと、コード実行と検証を組み合わせた手法Grounding2Routeを提案した。
- 非定常流れを味方につける:渦を活用する生体模倣推進を実現する高スループット学習プラットフォーム生体模倣推進/流体知能2026/9/13
実流体との相互作用を高速に大量取得する8チャネル装置と、模倣・オフライン学習・オンライン適応を段階的に行うアルゴリズムを組み合わせ、渦を利用した生体模倣推進の制御則を学習する枠組みを提案した。
- WAM-Diff2: 階層的AR-to-Diffusion蒸留による高効率自動運転VLAVLA2026/8/1
事前学習済みの自己回帰型VLAモデルを、並列実行可能な拡散モデルへ変換するための3段階の階層的蒸留戦略を提案し、推論速度を大幅に向上させつつ性能を維持する。
- 分解と再構成:デモから学習したプリミティブと視覚運動ポリシーによる計画操作計画2026/7/1
人間のデモを接触関係に基づいて原子スキルに分解し、視覚運動ポリシーとTAMPを統合して長期的な操作タスクを計画するフレームワークDR-LfDを提案した。
- Goal2Pixel: ナビゲーション目標をピクセルに接地する視覚言語ナビゲーションVLMナビゲーション2026/6/1
視覚言語ナビゲーションを、行動予測ではなく画像平面上のナビゲーション可能なピクセル接地として再定式化し、VLMの推論回数を大幅に削減しつつ高性能を達成した。
- キーポーズ探索:効率的な自動軌道ラベリングとクロスエンボディメントポリシー転送模倣学習/転移学習2026/6/1
把持関連タスクのデモからキーポーズを自動抽出するパイプラインを提案し、キーポーズ条件付き拡散ポリシーを訓練して、到達可能性マップによるフィルタリングで異なるロボットへのゼロショット転送を試みた。
- JoyAI-Image: 統一マルチモーダル理解と生成における空間知能の覚醒VLA2026/5/5
視覚理解・テキストからの画像生成・指示による画像編集を統合したマルチモーダル基盤モデルを提案し、空間認識能力を強化した。
- インピーダンス駆動の異方性誘導場による共有自律支援共有自律/遠隔操作2026/5/1
ロボットの意図を人間に物理的・直感的に伝えるため、インピーダンス制御に着想を得た誘導場を共有自律制御に組み込み、タスク性能と協調性を向上させた。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- AtomicVLA: ロボットにおける原子スキル学習の可能性を解き放つVLA/操作/継続学習2026/3/1
長期的・多段階のロボット操作タスクを扱うため、タスク計画・原子スキル抽象化・細粒度アクションを統合的に生成するフレームワークAtomicVLAを提案。スキル誘導型Mixture-of-Expertsによりスケーラブルな原子スキルライブラリを構築し、継続学習も可能にした。
- 拘束下での遊泳:四足生物模倣推進のための安全強化学習フレームワーク強化学習/遊泳ロボット2026/3/1
四足ロボットの遊泳を、推力を最大化しつつ不安定化力を最小化する制約付き最適化問題として定式化し、PID調整ラグランジュ乗数を用いた安全強化学習手法ACPPO-PIDを提案。模倣学習と実機曳航試験で初期化・調整し、自由遊泳への転移を実証した。
- BiKC+: キーポーズ条件付き協調認識型一貫性ポリシーによる両手階層模倣学習マニピュレーション2026/1/1
両手作業を階層的模倣学習で扱い、高レベルでキーポーズを予測し低レベルで一貫性モデルにより1ステップで軌道生成する手法を提案。
- Percept-WAM: 知覚強化型世界認識行動モデルによる堅牢なエンドツーエンド自動運転自動運転VLA2025/11/1
2D/3D知覚を単一の視覚言語モデルに統合し、World-PV/World-BEVトークンとグリッド条件付き予測で長尾・遠距離・小物体に強い自動運転モデルを提案。
- RTFF: 双腕マニピュレータによるランダムから目標への布平坦化ポリシーマニピュレーション2025/10/1
しわのある布を任意の目標姿勢に平坦化するタスクを定義し、メッシュ表現と模倣学習+ビジュアルサーボを組み合わせて実機双腕系で実現した。
- 固有感覚を考慮した双腕ヒューマノイドロボットの身体性計画に向けてVLA2025/10/1
双腕ヒューマノイド向けの新シミュレータDualTHORを構築し、固有感覚情報を組み込んだProprio-MLLMを提案。既存MLLMより計画性能が平均19.75%向上した。
- SViP: 物体中心の動作プリミティブによる両腕視覚運動ポリシーのシーケンス化マニピュレーション2025/6/1
人間のデモを両腕・片腕操作に分割し、視覚運動ポリシーとタスク・動作計画を統合することで、少ないデモでも長期的な両腕操作タスクを汎化可能にするフレームワークを提案。
- DualTHOR: 偶発的失敗を考慮した計画のための双腕ヒューマノイドシミュレーションプラットフォームsim2real2025/6/1
家庭環境で双腕ヒューマノイドロボットが協調作業するための物理シミュレータを構築し、低レベル実行時の偶発的失敗も再現することで、視覚言語モデルのロバスト性を評価できるようにした。
- 部分観測軌道ゲームにおけるオンライン競合情報収集ゲーム理論/情報収集2025/6/1
部分観測確率ゲームを有限履歴・有限ホライズンで近似し、粒子ベース推定と確率的勾配プレイを用いてオンラインで競合的な情報収集軌道計画を計算する手法を提案した。
- 見えざるものを見えるものから:基盤モデルによる観察・指示の書き換えで視覚言語ナビゲーションを拡張VLA2025/3/1
視覚言語ナビゲーションのデータ不足を解消するため、基盤モデルで訓練データの観察と指示を書き換えて新たなペアを生成し、未知環境への汎化を促す手法を提案。
- 超音波による時空間エンコードを用いたエンドツーエンド生成型オドメトリ・マッピングフレームワークSLAM2024/12/1
煙や粉塵など低視界環境でも使えるよう、超音波センサアレイの時空間情報を生成モデルで処理し、高密度点群と自己位置推定をエンドツーエンドで生成するSLAM手法を提案した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- VidMan: ビデオ拡散モデルの暗黙的ダイナミクスを活用したロボットマニピュレーションマニピュレーション2024/11/1
ビデオ拡散モデルを2段階で訓練し、未来の視覚軌道予測で環境ダイナミクスを学習した後、逆ダイナミクスモデルに変換してロボット操作の行動予測精度を向上させた研究。
- PIVOT-R: プリミティブ駆動型ウェイポイント認識ワールドモデルによるロボットマニピュレーションマニピュレーション2024/10/1
言語指示に基づくロボット操作のため、プリミティブ動作の解析とウェイポイント予測を行うワールドモデルを提案し、非同期階層実行により効率を大幅に向上させた。
- BiKC: 双腕ロボット操作のためのキーポーズ条件付き一貫性ポリシーマニピュレーション2024/6/1
双腕操作を高レベルなキーポーズ予測と低レベルな軌道生成に分けた階層的模倣学習フレームワークを提案し、高速推論と成功率・効率の向上を実現した。
- OpenOcc: 占有表現によるオープンボキャブラリ3Dシーン再構成3D再構成/オープンボキャブラリ2024/3/1
ニューラル放射輝度場と占有表現を組み合わせ、事前学習済みオープンボキャブラリモデルを蒸留することで、ゼロショットで3Dシーンの再構成と理解を同時に行うフレームワークを提案。
- NavCoT:分離推論の学習によるLLMベース視覚言語ナビゲーションの強化VLA2024/3/1
視覚言語ナビゲーション(VLN)において、LLMにナビゲーションの思考連鎖(世界モデルによる次観測の想像、候補選択、行動決定)を学習させ、ドメインギャップを効率的に埋める手法を提案。
- SUIT: Learning Significance-guided Information for 3D Temporal Detection2023/7/1
- ConQueR: Query Contrast Voxel-DETR for 3D Object Detection2022/12/1
- CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving2022/6/1
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving2022/3/1