Xiaoshuai Hao
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボット学習における潜在アクションの重要要素ロボット学習2026/8/20
ロボット操作のための潜在アクションモデル(LAM)の設計選択を体系的に比較し、41の設計選択肢を3次元で評価。VLMバックボーンの微調整が下流のポリシー学習に有効であることを示した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- 二値的成功を超えて:細粒度操作のための診断的メタ評価フレームワーク評価/操作2026/5/1
細粒度操作の能力を理解・知覚・制御行動の3軸に分解し、従来の二値的成功率では隠れる次元別の失敗を明らかにする診断的メタ評価フレームワークMetaFineを提案した。
- テキストと画像で考える:長期的ロボット操作のためのインターリーブ型視覚・言語推論トレース操作2026/5/1
長期的なロボット操作タスクにおいて、テキストによるサブゴールと視覚的なキーフレームを交互に配置した中間表現(トレース)を導入し、これを自己生成して動作デコーダに条件付けする新しいポリシーフレームワークを提案した。
- データ非対称潜在想像と再ランキングによる3Dロボット模倣学習模倣学習2026/5/1
低品質な軌跡データを活用するため、3D点群の潜在世界モデルによる想像ロールアウトとタスク完了スコアラによる再ランキングを組み合わせたフレームワークDALI-Rを提案し、模倣学習の成功率を向上させた。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- DriveWorld-VLA: 自動運転のための視覚-言語-行動と潜在空間世界モデルの統合VLA2026/2/1
VLAと世界モデルを潜在空間で統合し、行動条件付きの想像を特徴量レベルで行う自動運転フレームワークを提案。NAVSIMなどで最高性能を達成。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- DSBench:車外・車内リスクを評価する包括的ベンチマーク自動運転VLMベンチマーク2025/11/1
自動運転向けVLMの安全性評価のため、車外環境リスクと車内運転行動安全を10カテゴリ28サブカテゴリで統合評価する初のベンチマークDSBenchを構築し、98Kデータでの微調整が安全性を向上させることを示した。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- RoboAfford++: ロボット操作とナビゲーションのためのマルチモーダルアフォーダンス学習向け生成AI強化データセットアフォーダンス2025/11/1
物体の機能部位や配置可能領域などのアフォーダンスを細粒度で注釈付けした87万枚超の画像と200万件のQAペアからなるデータセットを構築し、評価ベンチマークも提案した論文。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- NavA³: あらゆる指示を理解し、どこへでも移動し、何でも見つけるナビゲーション2025/8/1
高レベルな人間の指示を理解し、実環境で空間認識を伴う物体ナビゲーションを行う階層型フレームワークNavA³を提案。大規模データで訓練したモデルにより、オープンボキャブラリな物体特定と精密な移動を実現した。
- VLMから時間的に一貫した報酬を学習なしで生成する手法VLA2025/7/1
VLMを用いてサブゴールの状態変化を追跡し、ベイズ推定で報酬を生成することで、追加学習なしにロボット操作の強化学習を高精度化するフレームワークを提案。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- RoboOS: クロスエンボディメントとマルチエージェント協調のための階層型具現化フレームワークマルチエージェント協調2025/5/1
脳と小脳の階層アーキテクチャに基づき、異なる身体を持つロボット間の協調と長期タスクの計画・実行を可能にするオープンソースの具現化システムを提案。
- VTLA:視覚・触覚・言語・行動モデルと選好学習による挿入操作マニピュレーション2025/5/1
視覚と言語に触覚を統合したVTLAモデルを提案し、選好最適化(DPO)で連続的なロボット操作を学習。ピン挿入タスクで90%以上の成功率と実機転移を実現した。
- AffordGrasp: 雑然環境におけるオープンボキャブラリなタスク指向把持のための文脈内アフォーダンス推論把持2025/3/1
視覚言語モデル(VLM)の推論能力を活用し、暗黙の指示からタスクを推論して対象物体とその部位レベルのアフォーダンスを特定し、機能を考慮した把持姿勢を生成するオープンボキャブラリな把持フレームワークを提案。
- TLA: 接触の多いマニピュレーションのための触覚-言語-行動モデル触覚2025/3/1
触覚フィードバックを言語と結びつけて処理するTLAモデルを提案し、ペグ挿入組立タスクで従来の模倣学習を上回る性能と未知条件への汎化を示した。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- MSC-Bench: 自動運転知覚におけるマルチセンサー劣化のベンチマークと分析自動運転知覚2025/1/1
カメラとLiDARの入力が個別または同時に劣化・欠損した際の自動運転知覚モデルの頑健性を評価する初の総合ベンチマークを提案し、3D物体検出6モデルとHDマップ構築4モデルを評価した。
- リーダー・フォロワー戦略を用いた階層型強化学習によるマルチUAV空戦フレームワーク群制御2025/1/1
6自由度空間でのマルチUAV空戦において、リーダー・フォロワー型マルチエージェントPPOと3層の階層構造を組み合わせ、高次元行動空間での協調戦略を学習する手法を提案した。
- あなたのHDマップ構築はセンサー劣化に耐えられるか?自動運転/HDマップ/ロバスト性2024/6/1
カメラやLiDARの29種類のセンサー劣化に対するHDマップ構築手法の頑健性を評価する初のベンチマークMapBenchを提案し、31手法を評価して性能低下を明らかにした。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- 基盤モデルがマニピュレーションのロボット学習にもたらすもの:サーベイマニピュレーション2024/4/1
基盤モデルをロボットのマニピュレーション学習に統合するための包括的枠組みを提案し、各モジュールでの課題と貢献、今後の研究方向を整理したサーベイ。