Yanyuan Qiao
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 領域到達からインスタンスレベルの接地へ:視覚と言語によるナビゲーションの改善VLA2026/7/1
VLNエージェントの最終位置の精度と対象物の可視性を評価する指標を導入し、最終段階のナビゲーションを改善するモジュールREALMを提案した。
- Fast-SmartWay: パノラマ不要のエンドツーエンドゼロショット視覚言語ナビゲーションVLA2025/11/1
正面のRGB-D画像3枚と言語指示のみからMLLMが直接行動を予測するゼロショットVLN-CEフレームワークを提案し、パノラマ観測とウェイポイント予測器を排除して遅延を大幅に削減した。
- Lang2Morph: 言語駆動によるロボットハンドの形態設計ロボットハンド設計2025/9/1
大規模言語モデルを用いて自然言語のタスク記述から3Dプリント可能なロボットハンドの形態を自動生成するパイプラインを提案した。
- 物体検出のための身体性ドメイン適応物体検出2025/6/1
家庭や実験室の動的な屋内環境で物体検出器を適応させるため、ソースデータ不要のドメイン適応手法を提案し、時系列クラスタリングやマルチスケール閾値融合、平均教師フレームワークを組み合わせた。
- Chain-of-Action: ロボットマニピュレーションのための軌道自己回帰モデリングマニピュレーション2025/6/1
目標から逆算して行動系列を自己回帰的に生成する視覚運動ポリシーを提案し、RLBenchと実機タスクで最先端性能を達成した。
- BadNAVer: 視覚言語ナビゲーションに対するジェイルブレイク攻撃の探索VLA2025/5/1
MLLM駆動の視覚言語ナビゲータに対する初の体系的なジェイルブレイク攻撃を提案し、シミュレータと実機で90%超の攻撃成功率を示した。
- FlexVLN: 多様な視覚言語ナビゲーションタスクへの柔軟な適応VLA2025/3/1
視覚言語ナビゲーションにおいて、教師あり学習ベースの指示追従器とLLMプランナーを階層的に統合し、検証機構とマルチモデル統合機構で幻覚を抑え、未知データセットへの汎化性能を大幅に向上させた。
- SmartWay: ゼロショット視覚言語ナビゲーションのためのウェイポイント予測とバックトラッキングの強化VLA2025/3/1
連続環境での視覚言語ナビゲーションにおいて、改良されたウェイポイント予測器とMLLMベースのナビゲータを組み合わせ、履歴推論とバックトラッキングを可能にしたゼロショットフレームワークを提案。
- COSMO: 選択的記憶の組み合わせによる低コスト視覚言語ナビゲーションVLA2025/3/1
視覚言語ナビゲーション(VLN)において、状態空間モジュールとトランスフォーマーを統合し、選択的状態空間モジュール(RSSとCS3)を導入することで、高性能と低計算コストを両立する新アーキテクチャCOSMOを提案した。
- 連続環境における地上視点の視覚と言語によるナビゲーションVLA2025/2/1
低視点の四足ロボット向けに、重み付き履歴観測と接続グラフ転移を用いて視覚と言語によるナビゲーションの汎化性能を高めるGVNavを提案した論文。
- 汎用ロボットマニピュレーションポリシーの効果的なファインチューニング戦略マニピュレーション2024/10/1
汎用マニピュレーションポリシーのファインチューニングにおいて、行動空間やポリシーヘッド、監督信号、調整可能パラメータの選択が性能に与える影響を大規模実験で調査し、低データ領域での有効な設計指針を提示した。
- Open-Nav: オープンソースLLMによる連続環境でのゼロショット視覚言語ナビゲーションの探求VLA2024/9/1
オープンソースLLMを使い、連続環境でのゼロショット視覚言語ナビゲーションを実現するOpen-Navを提案。時空間Chain-of-Thought推論と詳細な物体・空間知識でシーン認識を強化し、閉源LLMに匹敵する性能を示した。