Liang Wang
Institute of Automation, Chinese Academy of Sciences
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboAssist: 長期外科支援のための対話型ヒューマノイド計画ヒューマノイド計画2026/9/30
手術支援タスクにおいて、人間の作業状態を推定しながらロボットの行動計画をオンラインで更新し、安全性を保ちつつ長期タスクを遂行するエージェントフレームワークを提案。Unitree G1で実証。
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- SyncPlan: 明示的同期と適応的修正による長期的LLM協調マルチエージェント協調2026/8/1
LLMベースのマルチエージェント協調において、効率と適応性のトレードオフを解決するため、明示的な同期プリミティブとプラン陳腐化検出器を備えた計画・実行・修正フレームワークを提案した。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- 停止して判断する:マッピング不要の四足点検のための遅延を考慮した自己受容的ナビゲーション基本動作歩行2026/7/1
四足ロボットの階段頂上検出における制御ループの遅延がオーバーシュートを引き起こす問題を分析し、連続登攀ではなく「停止して判断する」リズムを提案して、オーバーシュートをほぼゼロに抑えた。
- 見ることが信じることではない ― 検索基盤型動画誤情報検出のベンチマーク誤情報検出2026/6/2
動画の誤情報を検出するため、ウェブ検索で関連動画を探し比較するベンチマークEVID-Benchを構築し、最先端モデルの性能が低いことを示した。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- 構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善VLA2026/6/1
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
- GUIDE: 目標初期化による方向理解を用いたエンドツーエンド視覚ナビゲーションナビゲーション2026/6/1
脚式ロボットのナビゲーションにおいて、目標をエピソード開始時に一度だけ与え、外部からの目標更新なしに内部の空間記憶と方向認識だけで動作するエンドツーエンドの強化学習フレームワークGUIDEを提案した。
- DiM-WAM: 多様な履歴イベントメモリを用いた世界行動モデリングVLA2026/6/1
長期依存タスク向けに、多スケールの履歴コンテキストとタスク進捗を統合したメモリ拡張型世界行動モデルを提案し、ロボット操作の成功率を大幅に向上させた。
- GaMi: 幾何学に依存しない材料識別のためのクロスモーダル減算的切り離し材料識別2026/5/29
ミリ波と音響センサを統合し、幾何学的変動の影響を除去して材料を識別するシステムを提案。クロスモーダルな減算的切り離しと対照学習により、未知の幾何条件でも高精度を実現。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- PUMA: 知覚駆動型統合足場事前分布による機動性拡張四足パルクール歩行2026/1/1
視覚知覚と足場の事前分布を単一段階の学習に統合し、地形特徴から自己中心的な極座標足場を推定して四足ロボットのパルクールを実現するフレームワークを提案。
- VERM:基盤モデルを活用した効率的な3Dロボット操作のための仮想視点マニピュレーション2025/12/1
複数の固定カメラの冗長な情報を基盤モデルで仮想視点に統合し、3D操作の精度と効率を向上させる手法を提案。
- 進化するエージェントのための身体知能コデザイン:分類・フロンティア・課題身体知能コデザイン2025/12/1
身体と制御を同時に最適化する「身体知能コデザイン(ECD)」の研究を体系的に整理し、階層的分類やベンチマーク、応用、今後の課題をまとめたサーベイ。
- RflyUT-Sim:複雑な低高度交通制御の開発・テスト用シミュレーションプラットフォームシミュレーション2025/12/1
低高度UAV交通の制御・管理・通信・異常モジュールを統合し、RflySim/AirSimとUnreal Engine 5で高忠実度なUAVモデルと3Dマップを実現したオープンソースのシミュレーションプラットフォームを提案。
- ZJUNlict 拡張チーム記述論文 2025群制御2025/11/1
ロボカップ小型リーグのZJUNlictチームが、IMU統合による姿勢精度向上や戦略・CUDAモジュールの最適化など、ハードウェアとソフトウェアの年間成果を報告した論文。
- SimScale: 実世界シミュレーションを大規模に活用した自動運転の学習自動運転/sim2real2025/11/1
既存の走行ログから大規模に未知の状態を合成するシミュレーション基盤を構築し、疑似専門家による行動監督と実データとの共同学習で計画性能の堅牢性と汎化を大幅に向上させた。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- EC-Flow: 動作ラベルなし動画からの多様なロボットマニピュレーションを可能にする身体中心フローマニピュレーション2025/7/1
動作ラベルなし動画から身体中心のフローを予測して模倣学習を行い、変形物体や遮蔽、非物体変位タスクにも対応するロボットマニピュレーション手法を提案した。
- BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメントVLA2025/6/1
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。
- 低遅延エッジSLAMのためのジョイントオフローディングとスケジューリングの統合エッジSLAM2025/2/1
移動ロボットのvSLAMをエッジサーバで支援する際に、入力変動と時間変化する要求に対応するため、領域特徴予測・圧縮/オフロード統合・制約付きスケジューリングを組み合わせた新アーキテクチャを提案し、姿勢推定精度の向上と通信コストの最大47%削減を実現した。
- MCRL4OR: オフロード環境知覚のためのマルチモーダル対照表現学習環境知覚2025/1/1
オフロード走行データにおいて、視覚画像・移動状態・制御行動を対照学習で統合し、下流の環境知覚タスクに有効なマルチモーダル表現を事前学習する手法を提案。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- TopoSD: SDマップを事前情報に用いたトポロジー強化レーンセグメント知覚自動運転知覚2024/11/1
低精度なSDマップをニューラル表現にエンコードしてBEV特徴に統合し、車線形状とトポロジーを同時に高精度予測する手法を提案。OpenLane-V2で大幅な精度向上を達成。
- GR-MG: 部分注釈データを活用するマルチモーダル目標条件付きポリシーマニピュレーション2024/8/1
テキスト指示と目標画像の両方で条件付けできるポリシーを提案し、部分的に注釈されたデータを活用してロボット操作の汎化性能を向上させた。
- Pose-Graph Attentional Graph Neural Network for Lidar Place Recognition2023/9/1
- ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments2023/4/1
- BEVBert: Multimodal Map Pre-training for Language-guided Navigation2022/12/1
- 1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)2022/6/1