Hangjun Ye
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 検索関連性を超えて:視覚言語運転のためのシーン接地型リスク含意VLA2026/9/28
運転シーンの知覚事実から知識グラフとSWRL推論でリスク関係を導出し、VLMと拡散プランナーの判断を条件付けることで、検索ベースの安全知識より計画安全性を向上させた。
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- ロボット学習における潜在アクションの重要要素ロボット学習2026/8/20
ロボット操作のための潜在アクションモデル(LAM)の設計選択を体系的に比較し、41の設計選択肢を3次元で評価。VLMバックボーンの微調整が下流のポリシー学習に有効であることを示した。
- SpatioLM: 視覚言語モデルにおける汎用物理空間知能の実現VLA2026/8/3
視覚言語モデルに追加の3D入力や外部エンコーダを使わず、パラメータ効率的なモジュールと擬似深度・カメラ情報の教師信号で空間推論能力を強化し、汎用性能の低下を抑えつつ空間知能を向上させた。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- Discrete-WAM: 世界モデルとポリシー学習のための統一離散ビジョン・アクショントークン編集自動運転/世界モデル2026/6/1
自動運転向けに、視覚観測・未来状態・高次決定・自車行動を共通の離散トークン空間で表現し、世界モデルとポリシーを統合学習するフレームワークを提案した。
- 空間認識型ワールドアクションモデルによる身体化ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための世界モデルベースのプランナーを改良し、開始と目標のRGB観測から中間のRGB-Dシーケンスと行動軌跡を同時生成するSWAMを提案。単眼RGB入力のみで高精度なナビゲーションを実現した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- 模倣を超えて:ハードネガティブから学ぶ安全なエンドツーエンド自動運転自動運転2026/5/1
成功事例だけでなく失敗事例も学習に取り入れることで、軌道の安全性を向上させる自動運転の模倣学習フレームワーク「BeyondDrive」を提案した論文。
- RotVLA: 回転潜在アクションを用いた視覚言語行動モデルVLA2026/5/1
連続的な回転群SO(n)上の潜在アクション表現を導入し、離散量子化の問題を解決したVLAモデルを提案。大規模データで事前学習し、下流タスクで高い性能を達成。
- テキストと画像で考える:長期的ロボット操作のためのインターリーブ型視覚・言語推論トレース操作2026/5/1
長期的なロボット操作タスクにおいて、テキストによるサブゴールと視覚的なキーフレームを交互に配置した中間表現(トレース)を導入し、これを自己生成して動作デコーダに条件付けする新しいポリシーフレームワークを提案した。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- XEmbodied: 大規模具現環境向けに幾何・物理的手がかりを強化した基盤モデルVLA/基盤モデル2026/4/1
クラウド側でVLMに3次元幾何認識と物理的手がかりを統合し、空間推論や具現化タスクの性能を向上させる基盤モデルを提案した。
- DriveVA: ビデオ行動モデルはゼロショット運転者である自動運転2026/4/1
自動運転のための世界モデルDriveVAを提案し、将来の映像と行動系列を共有の生成過程で同時に予測することで、ゼロショットでの汎化性能を向上させた。
- PerlAD: 擬似シミュレーションに基づく強化学習による閉ループエンドツーエンド自動運転の性能向上自動運転2026/3/1
オフラインデータから構築したベクトル空間上の擬似シミュレーションと予測ワールドモデルを用いて、レンダリング不要で効率的な強化学習による閉ループ自動運転を実現した。
- 失敗から学ぶ:テイクオーバーデータを用いた運転VLAのポストトレーニング自動運転/VLA2026/3/1
自動運転のVLAモデルに対し、テイクオーバー(人間介入)データを活用した新しいポストトレーニング手法TakeVLAを提案。介入前の言語指示とシナリオ再構築による強化学習で安全マージンを拡大し、ベンチマークで最高性能を達成した。
- MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転自動運転/軌道生成2026/2/1
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
- DriveWorld-VLA: 自動運転のための視覚-言語-行動と潜在空間世界モデルの統合VLA2026/2/1
VLAと世界モデルを潜在空間で統合し、行動条件付きの想像を特徴量レベルで行う自動運転フレームワークを提案。NAVSIMなどで最高性能を達成。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- 拡散モデルによるエンドツーエンド自動運転の可能性を解き放つ自動運転/拡散モデル2026/2/1
実車データと公道試験を通じて拡散モデルをエンドツーエンド自動運転のプランナーとして大規模に検証し、学習の鍵となる知見と強化学習による事後学習を提案、実車で10倍の性能向上を達成した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 二分的拡散方策最適化拡散方策/強化学習2026/1/1
拡散方策の強化学習において、報酬最大化と最小化の二つの方策に分解し、推論時にスコアを線形結合することで安定かつ制御可能な最適化を実現する手法を提案。
- MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデルVLA2025/12/1
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- DSBench:車外・車内リスクを評価する包括的ベンチマーク自動運転VLMベンチマーク2025/11/1
自動運転向けVLMの安全性評価のため、車外環境リスクと車内運転行動安全を10カテゴリ28サブカテゴリで統合評価する初のベンチマークDSBenchを構築し、98Kデータでの微調整が安全性を向上させることを示した。
- SimScale: 実世界シミュレーションを大規模に活用した自動運転の学習自動運転/sim2real2025/11/1
既存の走行ログから大規模に未知の状態を合成するシミュレーション基盤を構築し、疑似専門家による行動監督と実データとの共同学習で計画性能の堅牢性と汎化を大幅に向上させた。
- RoboAfford++: ロボット操作とナビゲーションのためのマルチモーダルアフォーダンス学習向け生成AI強化データセットアフォーダンス2025/11/1
物体の機能部位や配置可能領域などのアフォーダンスを細粒度で注釈付けした87万枚超の画像と200万件のQAペアからなるデータセットを構築し、評価ベンチマークも提案した論文。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- DriveMRP: 合成モーションデータによる視覚言語モデルのモーションリスク予測強化自動運転2025/7/1
BEVベースのシミュレーションで高リスクな運転モーションデータを合成し、視覚言語モデルのリスク予測性能を大幅に向上させるフレームワークを提案した。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。