Dong An
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーションナビゲーション2026/3/1
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- マルチモーダル融合と視覚言語モデル:ロボットビジョンのサーベイVLA2025/4/1
ロボットビジョンにおけるマルチモーダル融合手法と視覚言語モデルの応用をタスク指向で体系的にレビューし、課題と将来方向を整理したサーベイ。
- インコンテキスト模倣学習におけるアクショントークナイザの重要性模倣学習2025/3/1
インコンテキスト模倣学習において、既存のアクショントークナイザが時間的な滑らかさを保てない問題を指摘し、Lipschitz条件を課すVAE「LipVQ-VAE」を提案して安定した動作生成を実現した。
- ロボットナビゲーションにおける言語と計画:最先端モデルの多言語評価VLA2025/1/1
アラビア語を含む多言語の言語モデルを用いて、視覚と言語によるロボットナビゲーションの計画能力を評価した研究。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments2023/4/1
- BEVBert: Multimodal Map Pre-training for Language-guided Navigation2022/12/1
- 1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)2022/6/1