Zhe Liu
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マルチエージェント視覚言語ナビゲーションの体系化:定式化・ベンチマーク・手法マルチエージェントVLN2026/9/28
複数ロボットが依存関係や資源制約のあるサブタスクを協調してこなす視覚言語ナビゲーションを初めて体系的に定式化し、大規模ベンチマークMAVLNと協調型ナビシステムTRISSを提案した論文。
- PanoVLN: パノラマ視覚と言語による効果的なナビゲーションナビゲーション2026/9/28
パノラマ画像を用いた視覚言語ナビゲーションにおいて、行動予測・訓練監督・視覚表現を改良し、より広い視野を活かした長期的な行動計画と経路選択を可能にする手法を提案。
- StreamPI: 視覚・言語・行動モデルのためのストリーミング型マルチモーダル時間モデリングVLA2026/8/26
単一フレームのVLAモデルに追加パラメータなしで時間的推論能力を付与するフレームワークを提案し、実ロボットタスクで有効性を実証した。
- SRL-MPC: 形状を考慮した強化学習モデル予測制御ナビゲーション2026/8/21
異なる形状のロボット群や群衆の中での安全で効率的なナビゲーションを実現するため、強化学習でMPCのパラメータを適応的に調整する手法を提案した。
- 教えて育てる:汎用ロボット学習のためのエージェント中心アーキテクチャVLA2026/8/17
この論文は、少数のデモから再利用可能なスキルブロックを学習し、新しいシーンでそれらを組み合わせてタスクを実行するエージェント中心のアーキテクチャ(TGL)を提案し、再学習の負担を軽減する。
- 大規模シーン再構成のためのローカルからグローバルへのループクロージャを備えたマルチサブマップ暗黙的ニューラルSLAMSLAM2026/8/10
NeRFベースのSLAMを大規模環境に拡張するため、マルチサブマップ構造と二段階のループクロージャ機構を導入し、記憶爆発を防ぎつつ高精度な再構成とロバストな位置推定を実現した。
- ProtoAct: ウェットラボのプロトコルを具現化ロボット動作へ変換するVLA2026/8/3
生物学のウェットラボ手順書を、状態を考慮したロボット実行可能な行動系列に変換するフレームワークを提案。手順の欠落や不整合を検出・修正し、JSON形式の関数系列にマッピングする。
- BioVLN: 生物医学実験室における視覚言語ナビゲーションのためのシミュレーションプラットフォームナビゲーション2026/7/1
生物医学実験室のロボットが機器の操作可能な側面から安全に接近することを考慮した、視覚言語ナビゲーションのためのシミュレーションプラットフォームを提案した。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- Metis: 自動運転と都市ナビゲーションのための汎用かつ効率的なワールドアクションモデル自動運転2026/6/14
ビデオ生成と行動予測を分離したエンドツーエンドのワールドアクションモデルを提案し、推論時のビデオ生成を省略することで効率化しつつ、汎用性と性能を向上させた。
- Pipette: ウェットラボロボットのための具現化シミュレーションプラットフォーム、ベンチマーク、およびデータ効率的な拡張フレームワークシミュレーション/データ拡張2026/6/1
ウェットラボ(生物医学実験)ロボットの学習を効率化するため、カスタマイズ可能なシミュレータ、編集可能なアセット、限られたデモから訓練データを増強するパイプラインを備えたプラットフォーム「Pipette」を提案した。
- IR-SIM: ナビゲーション、学習、ベンチマークのための軽量スキルネイティブシミュレータシミュレーション2026/6/1
YAML設定だけでシナリオを定義できる軽量なナビゲーション用シミュレータIR-SIMを提案し、テキストからのシナリオ生成や学習データ生成、高忠実度シミュレータや実機への橋渡しを実現した。
- BioProVLA-Agent: 生物学的実験室操作のための手頃でプロトコル駆動・視覚強化・閉ループ推論可能なVLA搭載具身マルチエージェントシステムVLA/マルチエージェント/実験室自動化2026/5/1
生物実験室の自動化を目的に、プロトコルを入力として、LLMによるサブタスク分解、VLMによる状態検証、VLAによる実行を閉ループで行う低コストなマルチエージェントシステムを提案した。透明な実験器具や反射などの視覚的擾乱に強いオンライン拡張手法も導入している。
- MCNav: 記憶を考慮した動的認知地図によるゼロショット目標指向ナビゲーションナビゲーション2026/5/1
探索済み領域の情報を活用する記憶対応ナビゲーションフレームワークを提案し、目標の再検証と再探索戦略によりナビゲーション失敗を低減する。
- 視覚・音・言語・行動パラダイムに向けて:音中心操作のためのHEARフレームワーク操作2026/3/1
音をリアルタイムに活用した操作を実現するため、視覚・音声・言語・行動を統合した連続制御パラダイムVSLAを提案し、その実装としてHEARフレームワークを導入した。
- FASTER: リアルタイムフローVLAの再考VLA2026/3/1
フロー型VLAの反応遅延を分析し、Horizon-Aware Scheduleで直近動作のデノイズを1ステップに短縮してリアルタイム応答性を大幅に改善した手法を提案。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- PILOT: 非構造環境での移動操作のための知覚統合型低レベルコントローラ移動操作2026/1/1
人間型ロボットが複雑な非構造環境で安定して移動しながら操作を行うため、知覚情報と固有感覚を融合し、複数の運動スキルを専門家混合で調整する単一の強化学習ポリシーを提案。シミュレーションと実機で有効性を検証。
- 夢から想起へ:想像誘導型経験検索による記憶持続型視覚言語ナビゲーションVLA2025/10/1
世界モデルが将来のナビゲーション状態を想像して検索クエリとし、視点に紐づけた観察と行動パターンの記憶から関連経験を選択的に引き出す記憶持続型VLN手法を提案。
- 不確実性を見通す:視覚ナビゲーションにおけるロバストなタスク指向最適化視覚ナビゲーション2025/10/1
視覚ナビゲーションでデータ不足時に生じる知覚の不確実性を凸集合としてモデル化し、ロバスト最適化と統合することで未知環境への汎化性能を高める学習フレームワークNeuROを提案した。
- 好奇心は道を開く:マルチエージェント文脈校正による好奇心駆動型探索マルチエージェント強化学習2025/9/1
マルチエージェント強化学習において、仲間の行動から文脈を推論して好奇心を動的に校正し、ノイズを除去して効率的な探索を実現する手法CERMICを提案。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- BEV-GS: 鳥瞰図におけるフィードフォワードガウススプラッティングによる路面再構成路面再構成/ガウススプラッティング2025/4/1
単一フレームから鳥瞰図パラダイムで路面の形状とテクスチャを推定し、グリッドガウス表現でリアルタイムに高精度な路面再構成と新規視点合成を実現した。
- 変形可能な表面における触覚センシングのための学習強化型電子皮膚:電気インピーダンストモグラフィに基づくアプローチ触覚2025/4/1
EITベースの触覚センサは軟体ロボットに有望だが表面変形で性能が劣化する問題に対し、深層学習で変形情報とEITデータを融合し触覚再構成する手法を提案し、シミュレーションとハイドロゲル電子皮膚実験で有効性を示した。
- 想像による計画:視覚と言語によるナビゲーションのためのエピソード的シミュレーションとエピソード的記憶VLA2024/12/1
人間のエピソード的シミュレーションと記憶に着想を得て、エージェントが未来のシーンを想像しながら記憶を拡張するVLNアーキテクチャを提案し、SPLで最先端を達成した。
- 暗黙的シーン表現の不確かさを活用した視覚ナビゲーションの探索能力向上視覚ナビゲーション2024/11/1
NeRFの不確かさを利用して探索行動を促し、画像ゴールナビゲーションの性能を高めるエンドツーエンド手法を提案。
- PG-SLAM: 動的環境におけるフォトリアルで幾何学的に正確なRGB-D SLAMSLAM2024/11/1
ガウススプラッティングを拡張し、動的な人や物体の変形・動きをモデル化しつつ、フォトリアルな前景と静的背景を同時に再構成してカメラ位置推定を行うRGB-D SLAM手法を提案。
- FLAME: 都市環境におけるマルチモーダルLLMによるナビゲーション学習VLA2024/8/1
都市の視覚言語ナビゲーション向けに、3段階のチューニングでマルチモーダルLLMを適応させるエージェントFLAMEを提案し、Touchdownデータセットでタスク完了率を7.3%向上させた。
- End-to-end 2D-3D Registration between Image and LiDAR Point Cloud for Vehicle Localization2023/6/1
- Touch and deformation perception of soft manipulators with capacitive e-skins and deep learning2023/5/1
- See What the Robot Can't See: Learning Cooperative Perception for Visual Navigation2022/8/1
- Life-Long Multi-Task Learning of Adaptive Path Tracking Policy for Autonomous Vehicle2021/9/1
- The Holy Grail of Multi-Robot Planning: Learning to Generate Online-Scalable Solutions from Offline-Optimal Experts2021/7/1
- A Registration-aided Domain Adaptation Network for 3D Point Cloud Based Place Recognition2020/12/1
- Message-Aware Graph Attention Networks for Large-Scale Multi-Robot Path Planning2020/11/1
- End-to-End 3D Point Cloud Learning for Registration Task Using Virtual Correspondences2020/11/1
- Learning of Long-Horizon Sparse-Reward Robotic Manipulator Tasks with Base Controllers2020/11/1
- Mobile Robot Path Planning in Dynamic Environments through Globally Guided Reinforcement Learning2020/5/1
- SeqLPD: Sequence Matching Enhanced Loop-Closure Detection Based on Large-Scale Point Cloud Description for Self-Driving Vehicles2019/4/1
- Coordinating Large-Scale Robot Networks with Motion and Communication Uncertainties for Logistics Applications2019/4/1