Xijie Huang
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DiffWAM: 高速で効率的なナビゲーション世界行動モデルナビゲーション2026/9/30
凍結した動画基盤モデルの予測表現から直接UAVの連続的なカメラ軌道を生成する幾何条件付きナビゲーション世界行動モデルを提案し、オンボード実行を高速化するFastDreamerを導入した。
- NavGen: 視覚生成モデルを身体性3Dナビゲーションのスケーラブルなデータエンジンとして活用VLA2026/9/25
テキストから動画を生成するモデルをデータエンジンとして使い、屋内・屋外の視覚言語ナビゲーション(VLN)エピソードを約40万件生成し、実世界のドローン飛行実験で75%の成功率を達成した。
- TADreamer: ビデオ想像による陸空二モードロボットのゼロショット言語誘導3Dナビゲーションナビゲーション2026/9/17
生成ビデオから3Dウェイポイントを復元し、幾何情報でキャリブレーションすることで、陸空両用ロボットの言語指示ナビゲーションを学習なしで実現した。
- FlyMirage:生成的世界モデルによる多様でスケーラブルなUAV飛行データの完全自動生成パイプラインデータ生成2026/5/1
大規模言語モデルと生成的世界モデルを組み合わせ、高忠実度の3DGSシーンを自動生成し、UAVの飛行軌道を計画することで、多様で現実的な空中VLNデータセットを自動構築するパイプラインを提案した。
- PathPainter: 画像生成モデルの汎化能力を身体化ナビゲーションへ転移するナビゲーション2026/5/1
鳥瞰図画像を大域的な事前情報として用い、画像生成モデルで自然言語から目標地点と走行可能領域を推定し、クロスビュー位置合わせでドリフトを補正するナビゲーションシステムを提案。UAVで160mの長距離ナビゲーションを実証した。
- NavDreamer: 動画生成モデルをゼロショット3Dナビゲータとして活用ナビゲーション2026/2/1
動画生成モデルを言語指示とナビゲーション軌道のインターフェースとして用い、ゼロショットで3Dナビゲーションを実現するフレームワークを提案。
- 3D放射輝度場での学習とドメイン適応による単眼RGB画像での混雑環境飛行sim2real2025/12/1
3Dガウシアンスプラッティングによるフォトリアルなシミュレーションと敵対的ドメイン適応を組み合わせ、単眼RGB画像のみで混雑環境を飛行する方策を学習し、実世界へのゼロショット転移を実現した。
- 強化学習による反応的なアクロバット飛行飛行制御2025/5/1
強化学習でドローンの状態とアクロバット意図から直接制御指令を生成し、カリキュラム学習とドメインランダム化により、移動するゲートをくぐりながら連続背面飛行するなど極限機動を実機で実現した。
- Joint stereo 3D object detection and implicit surface reconstruction2021/11/1