Fang Li
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーションVLA/ナビゲーション2026/4/30
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- 考える前に進む:画像目標ナビゲーションのための階層的推論ナビゲーション2026/4/1
画像目標ナビゲーションを高レベル計画と低レベル実行に分解し、視覚言語モデルで短期的計画を生成して強化学習ポリシーを導く階層的フレームワークHRNavを提案。迷いを減らすペナルティも導入し、シミュレーションと実環境で有効性を実証した。
- NS-VLA:神経記号型視覚言語行動モデルVLA2026/3/1
視覚・言語特徴から記号的にプリミティブを抽出し、オンライン強化学習で行動系列を生成する神経記号型VLAフレームワークを提案。少データ・摂動環境で高精度かつゼロショット汎化を示す。
- 運転視覚幾何Transformer3D再構成2025/12/1
自動運転向けに、カメラパラメータ不要で多視点画像列からメートルスケールの密な3D点群と自車姿勢を推定するTransformerモデルを提案。
- DriveMRP: 合成モーションデータによる視覚言語モデルのモーションリスク予測強化自動運転2025/7/1
BEVベースのシミュレーションで高リスクな運転モーションデータを合成し、視覚言語モデルのリスク予測性能を大幅に向上させるフレームワークを提案した。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- MARS: 多模态能動ロボットセンシングによる関節物体の特性把握マニピュレーション2024/7/1
RGBと点群を融合し、強化学習で視点を能動的に選ぶことで、関節物体の関節パラメータを高精度に推定するフレームワークを提案。