Bingqian Lin
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- EchoVLA: 宣言的記憶を統合した移動マニピュレーション向け視覚-言語-行動モデルVLA2025/11/1
人間の脳に着想を得たシーン記憶とエピソード記憶を組み合わせ、移動と操作を協調させるメモリ対応VLAモデルを提案し、大規模学習用ベンチマークMoManiも構築した。
- PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマークベンチマーク/VLA2025/6/1
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
- 見えざるものを見えるものから:基盤モデルによる観察・指示の書き換えで視覚言語ナビゲーションを拡張VLA2025/3/1
視覚言語ナビゲーションのデータ不足を解消するため、基盤モデルで訓練データの観察と指示を書き換えて新たなペアを生成し、未知環境への汎化を促す手法を提案。
- PIVOT-R: プリミティブ駆動型ウェイポイント認識ワールドモデルによるロボットマニピュレーションマニピュレーション2024/10/1
言語指示に基づくロボット操作のため、プリミティブ動作の解析とウェイポイント予測を行うワールドモデルを提案し、非同期階層実行により効率を大幅に向上させた。
- 基盤モデルを用いたアフォーダンス指向の連続視覚言語ナビゲーション計画VLA2024/7/1
SAMで地面のアフォーダンスを抽出し、LLMが経由点と経路をゼロショットで計画する連続VLN手法AO-Plannerを提案し、R2R-CEとRxR-CEで最高精度を達成した。
- NavCoT:分離推論の学習によるLLMベース視覚言語ナビゲーションの強化VLA2024/3/1
視覚言語ナビゲーション(VLN)において、LLMにナビゲーションの思考連鎖(世界モデルによる次観測の想像、候補選択、行動決定)を学習させ、ドメインギャップを効率的に埋める手法を提案。
- 摂動を考慮した対照学習による逸脱に頑健なエージェントナビゲーションVLA2024/3/1
視覚と言語によるナビゲーション(VLN)エージェントが、障害物や人間の妨害などによる経路逸脱に対して頑健になるよう、経路摂動と対照学習を組み合わせた学習パラダイムPROPERを提案した。
- MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation2024/1/1