Jinlong Li
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA世界モデルナビゲーション自動運転/VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavJev: 行動中心の視覚圧縮と識別的行動意味記憶による効率的な視覚言語ナビゲーションVLA2026/9/28
MLLMの逐次推論をやめ、候補行動を圧縮表現に変換して軽量な確率的行動選択を行うことで、視覚言語ナビゲーションの推論遅延を大幅に削減したフレームワーク。
- 水中C3-JEPA:ROVサルベージのための物体中心クロスビュー世界モデル世界モデル2026/9/24
複数視点のRGB映像と制御信号から、接触や水流の遅れを考慮して対象物の状態変化を潜在空間で予測する物体中心の世界モデルを提案し、実水中映像で有効性を示した。
- 具現化視覚言語ナビゲーションの包括的サーベイと体系的実世界評価ナビゲーション2026/7/1
視覚と言語によるナビゲーション(VLN)の研究を体系的に分類し、物理ロボットでの実世界評価を行った。シミュレーションと実世界の性能差を明らかにし、階層的フレームワークの堅牢性を示した。
- P2DNav: パノラマから俯瞰への推論によるゼロショット視覚言語ナビゲーションナビゲーション2026/5/19
ゼロショットの視覚言語ナビゲーションにおいて、パノラマ方向選択と俯瞰ローカル接地を分離した階層的フレームワークを提案し、性能を向上させた。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- CLASH: 連続的視覚言語ナビゲーションのための大規模・小規模協調階層フレームワークVLA2025/12/1
視覚言語ナビゲーションにおいて、小規模モデルと大規模モデルを不確実性に基づき協調させ、シミュレーションと実環境で最先端性能を達成した。
- OPV2V: An Open Benchmark Dataset and Fusion Pipeline for Perception with Vehicle-to-Vehicle Communication2021/9/1