Rong Li
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 遅い推論器から速いプランナーへのトークン単位潜在ストリーミングによる動的視覚言語ナビゲーションナビゲーション2026/7/1
動的な人間中心環境での視覚言語ナビゲーションにおいて、遅いVLMの推論中に中間隠れ状態をストリーミングして高速なプランナーを逐次更新するSPARK-VLNを提案し、ナビゲーション成功率と社会的コンプライアンスを向上させた。
- FLUX: 整流フローと静的から動的への学習によるクロス身体性生成ナビゲーションポリシーの高速化ナビゲーション2026/3/1
動的ナビゲーションベンチマークDynBenchを導入し、フローベースの統一ナビゲーションポリシーFLUXを提案。直線軌道で推論を高速化し、静的から動的へのカリキュラムで社会的ナビゲーションと静的タスクの堅牢性を向上、ゼロショットで多種ロボットに転移可能。
- NavThinker: 社会的ナビゲーションにおける結合予測と計画のための行動条件付きワールドモデルナビゲーション2026/3/1
ロボットの行動に応じて将来のシーンと歩行者動態を予測する行動条件付きワールドモデルを強化学習と組み合わせ、社会的ナビゲーションの性能を向上させた。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- イベントカメラによる視覚的グラウンディングVLA2025/9/1
イベントカメラデータを用いた言語駆動型物体グラウンディングのための大規模ベンチマークTalk2Eventを構築し、動的環境でのマルチモーダル知覚を可能にした。
- Talk2Event: イベントカメラによる動的シーンの言語接地理解VLA2025/7/1
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
- 成功への階段:LLM駆動の粗から細への探索によるオンライン階層対応ゼロショット物体目標ナビゲーションフレームワークナビゲーション2025/5/1
事前地図や再学習なしで多階層建物内の物体を目指すゼロショットナビゲーションを実現するASCENTを提案。階層表現構築とLLMによる粗密探索でHM3D/MP3Dで最高性能を達成し、四足ロボットで実機検証した。
- 視覚言語モデルによるゼロショット3D視覚グラウンディング3D視覚グラウンディング2025/5/1
2Dの視覚言語モデルを活用し、3D専用の学習データなしで3Dシーン内の物体を自然言語で特定するゼロショット手法SeeGroundを提案。
- SeeGround: ゼロショットオープンボキャブラリ3D視覚グラウンディングのための見て接地する手法3D視覚グラウンディング2024/12/1
2D視覚言語モデルを活用し、3Dシーンをクエリに合わせたレンダリング画像と空間記述のハイブリッドで表現することで、ゼロショットでオープンボキャブラリな3D視覚グラウンディングを実現した。