Xiaohao Xu
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Depth Any Seen:どの面がどこまで見えるか深度推定2026/9/25
1枚の画像から複数の可視面の存在と距離を同時に推定するマルチベルヌーイ深度集合手法を提案し、過剰予測を大幅に削減した。
- 検索が記憶になるとき:ロボット設計の試行錯誤を転移可能なスキルへ変換する進化ロボット設計/LLM2026/5/1
進化的ロボット設計の探索履歴を自然言語のスキルライブラリとして蓄積し、LLMエージェントがそれを参照して設計を改善する自己進化システムを提案した。
- 探索を超えた潜在幾何学:ワールドモデルにおける計画の償却計画/ワールドモデル2026/5/1
滑らかで一様な潜在空間を持つ事前学習済みワールドモデルにおいて、反復的なオンライン探索を軽量な目標条件付き逆動力学モデル(GC-IDM)に置き換え、計画を償却する手法を提案。4つのベンチマークでCEM等と同等以上の性能を維持しつつ、計算コストを100〜130倍削減した。
- 視覚言語モデルにおける衝突接地の探求:安全な人間ロボット協調のためにVLA/安全性評価2026/5/1
人間とロボットの安全な協調のため、視覚言語モデルが現在の接触状態や差し迫った衝突を正確に判断できるかを評価するベンチマーク「TouchSafeBench」を導入し、既存モデルの性能が不十分であることを示した。
- 3Dミラージュ:単眼深度推定における幻覚の探求と抑制単眼深度推定2025/12/1
単眼深度基盤モデルが平面や曖昧な入力から誤った3D構造を幻覚する現象「3D Mirage」を定義し、その評価ベンチマークと指標、および幻覚領域を選択的に修正するGrounded Self-Distillationを提案した。
- 全身固有感覚モーフィング:堅牢なクロススケール把持のためのモジュラーソフトグリッパソフトグリッパ2025/10/1
タコに着想を得て、自己感知型のモジュラー空気圧アクチュエータを分散配置し、グリッパ全体の形状を多角形などに再構成できるソフトグリッパを開発。ピンチから包み込み把持まで対応し、多様な形状・スケールの物体把持を実現した。
- ViSA-Flow: 大規模動画の意味的行動フローによるロボットスキル学習の加速マニピュレーション2025/5/1
人間の物体操作動画から「意味的行動フロー」を自己教師ありで学習し、それをロボットの少数デモに適応させることで、低データでも操作スキルを効率的に獲得するフレームワーク。
- 曖昧さのない空間基盤モデルに向けて:深度曖昧性の再考と分離空間理解2025/3/1
透明シーンなどで生じる深度曖昧性に対処するため、単一予測ではなく複数仮説を扱う空間基盤モデルを提案し、学習不要のラプラシアン視覚プロンプトで多層深度を推定する手法を開発した。
- 基盤モデルによるソフトロボット進化のための自然選択ソフトロボティクス2025/3/1
LLMがソフトロボット設計の表現を学習できるかを評価するベンチマークRoboCrafter-QAを提案し、ファインチューニングしたLLMが高性能な形態の選択・生成でSOTAを達成、実機でもsim-to-real相関を確認した。
- ノイズを含む動画からのロバストな自己運動推定と3D再構成のためのスケーラブルなベンチマークと学習3D再構成2025/1/1
ノイズの多い動画でも高精度な自己運動推定と3D再構成を実現するため、ノイズ合成パイプラインとベンチマークRobust-Ego3Dを構築し、テスト時適応手法CorrGSを提案した。
- 完全からノイズ世界シミュレーションへ:SLAMロバスト性ベンチマークのためのカスタマイズ可能な身体性マルチモーダル摂動SLAM2024/6/1
RGB-D SLAMモデルのロバスト性評価のため、センサ・運動摂動を体系的に分類し合成するパイプラインと大規模ベンチマークNoisy-Replicaを提案した。
- 共有RGB-Dフィールドの学習:LiDAR-カメラ3D知覚のためのラベル効率の良い統一自己教師あり事前学習VLA2024/5/1
LiDARとカメラの3D知覚モデル向けに、NeRFを活用して両モダリティを統一的にマスク再構成する自己教師あり事前学習手法NS-MAEを提案し、ラベル効率の良いファインチューニングで従来手法を上回る性能を示した。
- LiDAR配置は3Dシーン理解に最適化されているか?LiDAR配置最適化2024/3/1
複数LiDARの配置を最適化する指標M-SOGと最適化戦略を提案し、悪天候やセンサ故障を含む大規模データセットで3D物体検出とセマンティックセグメンテーションの性能向上を示した。
- Customizable Perturbation Synthesis for Robust SLAM Benchmarking2024/2/1
- Towards Transferable Multi-modal Perception Representation Learning for Autonomy: NeRF-Supervised Masked AutoEncoder2023/11/1
- Influence of Camera-LiDAR Configuration on 3D Object Detection for Autonomous Driving2023/10/1
- Optimization of Forcemyography Sensor Placement for Arm Movement Recognition2022/7/1