Wenhao Li
Shenzhen Institute of Artificial Intelligence and Robotics for Society
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DSDyn-VLA:動き知覚・未来予測・リアルタイム補正を備えた二重ストリーム動的マニピュレーション枠組みVLA2026/9/30
動的環境でのVLAの知覚・遅延・制御ギャップを解決するため、遅いFlow-Plannerと速いRes-Refinerからなる二重ストリーム枠組みを提案し、動的物体操作ベンチマークDynBenchを導入した。
- CodeActionBench:身体性マニピュレーションのためのエージェント型Code-as-Policy評価マニピュレーション2026/9/27
汎用マルチモーダルモデルが実行可能コードを通じて視覚理解と推論を身体性マニピュレーションに変換できるかを評価する25タスクのベンチマークを提案し、9構成・675試行で成功率2.7〜73.3%を報告した。
- 安全フィルタ付き分散Koopman-MPC分散制御/安全MPC2026/9/23
受信軌道でKoopman-MPCを行い、局所センシングと棚形状に基づくQPで入力を安全に射影する分散制御手法を提案し、パケット損失下でも衝突回避を実現した。
- SCULPT-VLA: 段階的行動グラウンディングによる構造化制御の学習VLA2026/9/20
VLAポリシーにおいて、タスク進行・シーン動態・空間グラウンディングの要素を段階的に学習させ、教師なしで連続制御を洗練する手法を提案。LIBEROや実機タスクで成功率を向上させた。
- LIFD: ロボットマニピュレーションのための3D認識シーン記憶を実現するアンカード拡散モデルマニピュレーション2026/9/17
単一RGB視点とリカレントメモリから3D認識のシーントークンを拡散モデルで補完し、マニピュレーションポリシーに接続するシーン記憶フレームワークを提案。LIBEROやMetaWorld、実機UR5eで高い成功率を達成した。
- WLA³: 意味・動力学・運動学のための世界潜在行動モデリングVLA2026/9/14
世界状態の変化から潜在行動を学習し、意味・動力学・運動学を統合した汎用ポリシーモデルを構築するフレームワークを提案。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- GeoProp: ロボット状態を視覚に接地する汎用操作のための手法マニピュレーション2026/7/1
ロボットの状態と視覚特徴を幾何学的に整合させる軽量アダプタを提案し、操作ポリシーの性能を向上させた。
- OPINE-World: オントロジー誤差優先の対話的探索によるARC-AGI-3向けプログラム的世界モデリング世界モデル2026/7/1
LLMエージェントが環境との相互作用からオブジェクト中心のプログラム的世界モデルをオンライン学習する手法を提案し、ARC-AGI-3ベンチマークで高い性能を達成した。
- 固定カメラから自由カメラへ:キャリブレーション不要の視点ロバストな視覚言語行動モデルVLA2026/7/1
カメラの位置が変わっても、その位置情報を明示的に与えずにロボットが自分で視点を推定して操作できる新しいVLAモデルを提案した。カメラ中心の動作予測と手と目の関係行列の予測を組み合わせ、単眼RGB画像だけで多様な視点で成功率を向上させる。
- WMLLM: 予測してから行動する世界モデルによる自己進化型最適化エージェント最適化2026/6/2
大規模言語モデルを用いて、ブラックボックス最適化の探索効率を高める自己進化型エージェントフレームワークを提案した。候補生成前に有望な方向を予測する世界モデルを組み込み、分子最適化などで高い性能を示した。
- JoyAI-Sim: 具現化データピラミッドのためのシミュレーション対応相互変換ツールチェーンシミュレーション2026/6/1
実ロボットのデータ収集と評価の限界を補うため、シミュレーションを介してロボットと人間のデータを相互変換するツールチェーンを提案し、評価とデータ生成のスケーラビリティを向上させる。
- Sentinel-VLA: 動的推論とエラー回復のための能動的状態監視を備えたメタ認知VLAモデルVLA/ロボット操作2026/5/1
VLAモデルに能動的な状態監視モジュールを追加し、必要時のみ動的推論やエラー回復を行うメタ認知型モデルを提案。自己進化的継続学習と直交アダプタにより性能向上と破滅的忘却防止を実現し、実機で成功率を30%以上向上させた。
- VLA-ATTC: 相対アクション批評モデルによるVLAモデルの適応的テスト時計算VLA/意思決定2026/5/1
VLAモデルに不確実性に基づく「認知クラッチ」を導入し、複雑な状況でのみ推論フェーズへ切り替える適応的テスト時計算フレームワークを提案。相対比較で最適アクションを選ぶ批評モデルにより、LIBERO-LONGでSOTAの失敗率を50%以上削減した。
- タンゴは二人で踊る:ロボット倉庫における注文スケジューリングとマルチエージェント経路探索の統合シミュレータsim2real2026/2/1
ロボット倉庫の注文スケジューリングと経路探索を分離せず統合し、物理制約や障害回復も考慮したシミュレータWareRoverを提案。既存手法が現実的な制約下で苦戦することを示した。
- VAT: ViTの全表現を活用する視覚行動トランスフォーマーVLA2025/12/1
ViTの全層の特徴を行動生成に融合させるVATを提案し、LIBEROベンチマークで98.15%の成功率を達成した模倣学習モデル。
- 3D推論駆動型プランニング:暗黙の人間意図から経路考慮型活動計画へタスクプランニング2025/3/1
暗黙の指示から意図を推論し、3Dシーンの形状・位置情報を活用して経路計画を含む多段階タスク計画を生成する新タスクとベンチマーク・手法を提案した。
- SkyRover: ドメイン横断型経路探索のためのモジュラーシミュレータsim2real2025/2/1
UAVとAGVが協調するマルチエージェント経路探索(MAPF)のためのモジュラーシミュレータを提案し、地上と空中の運用を統合してアルゴリズム設計・テスト・ベンチマークを可能にした。
- LLMで強化したシーングラフ学習による家庭内整理タスクシーングラフ/LLM/整理タスク2024/8/1
家庭内の物の配置換えタスクに向けて、LLMを活用してシーングラフを拡張し、物の機能とユーザー選好を考慮した配置計画を可能にする手法を提案した。
- C³P-VoxelMap: コンパクト・累積・統合可能な確率的ボクセルマッピングSLAM/マッピング2024/6/1
LiDARオドメトリ向けに、点群を保持せず統計量のみを累積更新する確率的ボクセルマップを提案し、さらに同一平面のボクセルを遅延統合することでメモリ削減と精度向上を実現した。
- 協調mTSPによる同期型双腕再配置マニピュレーション2024/3/1
双腕ロボットの再配置を協調コストを共有するmTSPとして定式化し、注意機構付き強化学習とコスト予測器で効率的に計画する手法を提案した。
- Learning Dual-arm Object Rearrangement for Cartesian Robots2024/2/1
- Efficient Planning with Latent Diffusion2023/9/30
- Multi-Agent Path Finding with Prioritized Communication Learning2022/2/1