Yi Liu
Shanghai Innovation Institute
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- STAR: 視覚・触覚・言語・行動モデルにおけるスパース触覚表現学習による巧みなマニピュレーションマニピュレーション2026/9/11
200時間の双腕巧みな操作データセットを構築し、触覚信号のスパース性に対処する視覚・触覚・言語・行動モデルSTARを提案。実世界4タスクで平均61%の成功率を達成した。
- τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデルVLA2026/8/17
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
- STAR-VLM: 自動車レーダー監視による動きと速度推定のための時空間接地視覚言語モデルVLA2026/8/2
自動車レーダーのドップラー計測を教師信号として用い、視覚言語モデルの時空間推論とメートル単位の速度推定能力を向上させるフレームワークを提案した。
- CRISP: 予測型ワールドモデル事前学習による運転用時空間カメラ・レーダーバックボーン自動運転/自己教師あり学習2026/7/1
カメラとレーダーの融合表現を、将来のLiDAR点群予測という事前学習タスクで学習するバックボーンを提案。推論時はカメラとレーダーのみで動作し、下流タスクに転移可能。
- 部分観測下での効率的な経路計画のための時空間決定事前分布の学習経路計画2026/7/1
デモ軌跡から時空間の決定事前分布を抽出し、部分観測下の経路計画を効率化する学習フレームワークImiPathを提案した。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- 身体性AIにおける安全性:リスク、攻撃、防御のサーベイ安全性2026/5/1
身体性AIの安全性に関する研究を、知覚から計画、行動、相互作用までのパイプライン全体にわたって体系的にレビューし、攻撃と防御の多層的な分類法を提案した論文。
- GGD-SLAM: 動的環境向け汎用運動モデルを活用した単眼3DGS SLAMSLAM2026/4/1
動的環境下でのカメラ位置推定と高精細な稠密マッピングを、事前の意味注釈や深度入力なしで実現する、汎用運動モデルを用いた単眼3DGS SLAMフレームワークを提案した。
- Libra-VLA: 非同期の粗密デュアルシステムによる学習均衡の実現VLA2026/4/1
VLAモデルを粗い意図予測と細かい動作生成の2段階に分離し、学習負荷の均衡と非同期実行を実現する新しいアーキテクチャを提案した。
- RMGS-SLAM: リアルタイム・マルチセンサーガウシアンスプラッティングSLAMSLAM2026/4/1
LiDAR・慣性・視覚センサーを統合し、3Dガウシアンスプラッティングを用いたリアルタイムSLAMフレームワークを提案。大規模環境での高精度な位置推定とフォトリアリスティックなマッピングを実現する。
- OVAL: 生涯物体ゴールナビゲーションのためのオープンボキャブラリ拡張メモリモデルナビゲーション2026/4/1
生涯にわたって複数の物体を連続的に探索する物体ゴールナビゲーションの課題に対し、オープンボキャブラリのメモリフレームワークと確率ベースの探索戦略を提案し、長期的なナビゲーション効率を向上させた。
- HazardArena: 視覚言語行動モデルにおける意味的安全性の評価VLA/安全性評価2026/4/1
視覚言語行動モデル(VLA)の安全性を評価するベンチマークを構築し、安全/危険の双子シナリオで意味的文脈による不安全行動を検出。訓練不要のSafety Option Layerで不安全行動を低減する手法も提案。
- 観測適応型軌道予測のための時間適応的プログレッシブ蒸留軌道予測2026/3/1
可変長の観測履歴に対応する軌道予測フレームワークTaPDを提案。長い履歴の教師から短い履歴の生徒へ知識を蒸留し、極端に短い履歴は過去の補完モジュールで補うことで、予測精度を向上させる。
- 回復して予測する:可変長軌道予測のための段階的回顧学習軌道予測2026/3/1
不完全な可変長の軌跡データから完全な軌跡を予測する問題に対し、段階的に特徴を整列させる回顧的枠組みを提案した。
- 実世界の屋内ツアー動画から得たマルチモーダルイベント知識による視覚言語ナビゲーションの強化VLA2026/2/1
実世界の屋内動画からマルチモーダル時空間知識グラフを構築し、粗い指示や長期的推論を要する視覚言語ナビゲーションにイベント知識を統合する手法を提案した論文。
- ACoT-VLA: 視覚言語行動モデルのための行動連鎖推論VLA2026/1/1
行動空間で直接推論する「行動連鎖推論(ACoT)」を提案し、粗い行動意図を明示的・暗黙的に生成して最終方策を導くVLAアーキテクチャを実現した。
- CausalNav: 動的屋外環境における自律移動ロボットのための長期 embodied ナビゲーションシステムナビゲーション2026/1/1
LLMを用いた多層意味シーングラフ(Embodied Graph)を構築し、RAGによるオープン語彙クエリでの長距離計画と動的屋外環境でのロバストなナビゲーションを実現した。
- SOP:視覚-言語-行動モデルのためのスケーラブルなオンライン事後学習システムVLA2026/1/1
ロボット群が実世界で収集した経験と人間の介入をクラウド上の学習器に非同期で送り、更新された方策を即座に受け取るオンライン分散事後学習システムを提案。布畳みや箱組立などのタスクで大規模VLAモデルの性能を数時間で大幅に向上させる。
- FishDetector-R1: 弱教師あり魚検出・セグメンテーション・計数のための強化学習ファインチューニングを備えた統合MLLMフレームワーク水中知覚/弱教師あり学習2025/12/1
マルチモーダル大規模言語モデルと検証可能報酬による強化学習を組み合わせ、弱い教師信号だけで水中の魚の検出・領域分割・計数を高精度に行う統合フレームワークを提案した。
- 自己回帰離散事前学習による身体性VLM推論とロボット行動の統合VLA2025/12/1
身体性推論を評価するベンチマークERIQと、連続制御を離散化するFACTトークナイザを提案し、推論と行動を統合したGenieReasonerで実世界マニピュレーション性能を向上させた。
- DyPho-SLAM:動的環境におけるリアルタイムフォトリアリスティックSLAMSLAM2025/9/1
動的物体を含む環境で、マスク生成と適応的特徴抽出によりカメラトラッキングと高精細マップ生成をリアルタイムで高精度に行うSLAMシステムを提案。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- Range-SLAM: 超広帯域信号による煙環境対応のリアルタイム自己位置推定と地図構築SLAM2024/9/1
LiDARやカメラが使えない煙などの劣悪環境で、UWB信号の距離とRSSIのみを用いて2次元占有格子地図をリアルタイム構築し、重み付き最小二乗法で高精度に自己位置推定する軽量SLAMシステムを提案。
- ExploitFlow, cyber security exploitation routes for Game Theory and AI research in robotics2023/8/1
- DSL-Assembly: A Robust and Safe Assembly Strategy2023/2/1
- SIRL: Similarity-based Implicit Representation Learning2023/1/1
- GOMP-FIT: Grasp-Optimized Motion Planning for Fast Inertial Transport2021/10/1
- Real-Time Trajectory Planning for AGV in the Presence of Moving Obstacles: A First-Search-Then-Optimization Approach2019/2/1
- Parallax Bundle Adjustment on Manifold with Convexified Initialization2018/7/1