Yaqi Xie
収録論文 10本 ・ フィジカルAI/ロボット学習
VLMナビゲーション強化学習記号的世界モデルパーツセグメンテーションマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Goal2Pixel: ナビゲーション目標をピクセルに接地する視覚言語ナビゲーションVLMナビゲーション2026/6/1
視覚言語ナビゲーションを、行動予測ではなく画像平面上のナビゲーション可能なピクセル接地として再定式化し、VLMの推論回数を大幅に削減しつつ高性能を達成した。
- 長期的ロボットタスクのための一般化可能な密な報酬強化学習2026/4/1
LLMとVLMを用いてタスク進捗を認識する外部報酬と、ポリシーの自己確信度に基づく内部報酬を組み合わせた密な報酬フレームワークVLLRを提案し、長期的タスクにおけるRL微調整を手動報酬設計なしで改善した。
- 深層述語発見と事前学習済み基盤モデルの統合記号的世界モデル2025/12/1
LLMが提案する述語効果分布と低レベルデータからのニューラル述語学習を相互に洗練させる二層学習フレームワークUniPredを提案し、ロボットの長期タスクにおける記号的世界モデル構築を効率化した。
- InstructPart: 指示に基づくタスク指向型パーツセグメンテーションパーツセグメンテーション2025/5/1
物体を構成する部品ごとに分割し、指示されたタスクに応じて適切な部品を切り出すベンチマークInstructPartを提案し、既存の視覚言語モデルでも難しいことを示した上で、データセットでの微調整により性能を倍増させるベースラインを提示した。
- ShapeGrasp: 幾何分解と大規模言語モデルによるゼロショットタスク指向把持マニピュレーション2024/3/1
物体を凸形状に分解してグラフ表現し、大規模言語モデルの常識推論で各部位に意味を割り当てることで、未知物体でもタスクに適した部位をゼロショットで把持する手法を提案。
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- Translating Natural Language to Planning Goals with Large-Language Models2023/2/1
- Embedding Symbolic Temporal Knowledge into Deep Sequential Models2021/1/1
- Robot Capability and Intention in Trust-based Decisions across Tasks2019/9/1
- Multi-Task Trust Transfer for Human-Robot Interaction2018/7/1