Shijie Li
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Talk2Escape: 対話による視覚言語ナビゲーションの閉ループ化視覚言語ナビゲーション2026/9/23
ナビゲーションエージェントの迷走を検知したら対話で修正指示を求める仕組みを提案し、シミュレータと実機で成功率と頑健性を向上させた。
- 報酬が見合うときだけ質問する:コストを考慮したオープンエンド対話によるインスタンス目標ナビゲーションナビゲーション2026/6/2
インスタンス目標ナビゲーションにおいて、曖昧な指示を解決するためのオラクルへの質問コストを考慮し、情報利得に基づいて質問タイプと重みを学習し、効率的な対話ナビゲーションを実現する手法を提案した論文。
- Ego2World: 一人称調理動画を実行可能な世界へ変換し信念状態計画を行う計画/ベンチマーク2026/5/13
一人称調理動画から実行可能なシンボリック世界を構築し、部分観測下での信念状態計画を評価するベンチマークを提案した論文。
- IntentionNav: 暗黙的な人間の指示からの意図駆動型物体ナビゲーションのベンチマークナビゲーション2026/5/1
物体のカテゴリ名を直接与えず、人間の暗黙的な意図(例:「これを温めたい」)から目標物体を推論して探索する「意図駆動型物体ナビゲーション」のベンチマークを提案し、VLMを用いた評価を行った。
- PRISM: シミュレーション環境における意図を伴う計画と推論ベンチマーク2026/5/1
LLMベースの身体性エージェントの失敗原因を、知覚・推論・長期計画のどの能力に起因するかを診断するベンチマークPRISMを提案した論文。
- 万物を導く一つのエージェント:明示的な世界表現によるMLLMの視覚言語ナビゲーション強化VLA2026/2/1
MLLMを用いたナビゲーションで、低レベル空間推定と高レベル意味計画を分離し、インタラクティブな計量世界表現と反事実推論を導入することで、ゼロショットで最先端性能を達成し、実機移行も実証した。
- DV-VLN: LLMベース視覚言語ナビゲーションのための信頼性の高い二重検証VLA2026/1/1
LLMによる視覚言語ナビゲーションで、生成した行動候補を真偽検証とマスク実体検証の二重チャネルで検証し、信頼性を高めるフレームワークを提案。
- 視覚言語モデルによるゼロショット3D視覚グラウンディング3D視覚グラウンディング2025/5/1
2Dの視覚言語モデルを活用し、3D専用の学習データなしで3Dシーン内の物体を自然言語で特定するゼロショット手法SeeGroundを提案。
- SeeGround: ゼロショットオープンボキャブラリ3D視覚グラウンディングのための見て接地する手法3D視覚グラウンディング2024/12/1
2D視覚言語モデルを活用し、3Dシーンをクエリに合わせたレンダリング画像と空間記述のハイブリッドで表現することで、ゼロショットでオープンボキャブラリな3D視覚グラウンディングを実現した。
- Toward An Optimal Selection of Dialogue Strategies: A Target-Driven Approach for Intelligent Outbound Robots2022/6/1
- Moving Object Segmentation in 3D LiDAR Data: A Learning-based Approach Exploiting Sequential Data2021/5/1
- Foresight Social-aware Reinforcement Learning for Robot Navigation2021/5/1