Zhiqi Li
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA視覚場所認識
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- 外洋から密閉キャビンへ:海事認識とキャビン点検のためのクロスシーン視覚場所認識ProteusVPR視覚場所認識2026/6/1
船舶環境での視覚場所認識の課題に対し、2段階の検索・精密化フレームワークProteusVPRを提案し、新しい船舶搭載データセットXHZで精度を大幅に向上させた。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation2023/7/1
- Prototype Design and Efficiency Analysis of a Novel Robot Drive Based on 3K-H-V Topology2022/10/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1