Anh Dao
VinMotion, Inc.
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAナビゲーションVLA/ナビゲーション3D視覚グラウンディング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AdaGeoVLN: 視覚言語ナビゲーションのための表現深度とナビゲーション時間にわたる選択的幾何情報VLA2026/9/16
視覚言語ナビゲーションにおいて、幾何基盤モデルの階層的特徴をポリシーの各段階に融合し、指示関連性・幾何信頼度・遷移新規性に基づいて履歴KV状態を選択的に保持するストリーミングフレームワークを提案。
- OpenBelief-Nav: オープン語彙言語誘導ナビゲーションのための証拠保持オブジェクトメモリナビゲーション2026/8/14
オープン語彙の3Dシーングラフで、観測レベルのフレーズや信頼性情報を保持するオブジェクトメモリを提案し、タスク固有の読み出しで固定語彙投影や自由形式検索を行う。ナビゲーション実験で性能向上を確認した。
- HumanoidVLN:多様な人型ロボットのための物理基盤シミュレータと視覚言語ナビゲーションベンチマークVLA/ナビゲーション2026/8/1
二足歩行の物理制約や人型ロボットの形態差を考慮した、視覚言語ナビゲーションのための物理シミュレータとベンチマークを構築した。4種類の人型ロボットと複数のVLNモデルを統合し、933の衝突考慮エピソードを提供する。
- IndustryNav: 動的産業環境における身体性エージェントの空間推論ベンチマークナビゲーション2025/11/1
動的な倉庫を再現したUnity環境で、視覚言語モデルによる能動的なナビゲーションと空間推論を評価する初の産業向けベンチマークを提案し、最先端モデルの安全性や計画能力の課題を明らかにした。
- Audio-3DVG:音声と点群の統合による3D視覚グラウンディング3D視覚グラウンディング2025/7/1
音声指示から3D点群中の対象物体を特定するタスクに対し、物体言及検出と音声誘導注意を組み合わせたフレームワークを提案し、標準データセットに音声記述を合成して評価した。