Pengwei Wang
Beijing Academy of Artificial Intelligence
収録論文 42本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- HACo: 力覚対応の巧みな操作のための触覚アクティブコンプライアンス学習マニピュレーション2026/9/29
指尖触覚と関節トルクを統合し、接触力を調整しながら動作する巧みな操作ポリシーを学習する手法を提案。実機で摩擦・回転トルク・変形物体操作など多様なタスクにおいて83%の平均成功率を達成した。
- LiMA: 非同期拡散による長期想像からリアルタイム巧みな操作への橋渡しマニピュレーション2026/9/23
低速な長期意図生成と高速な動作精緻化を非同期に分離した二重システム拡散フレームワークで、両腕巧みな操作をリアルタイムに実行する。
- DIDO: インタラクション中心のダイナミクスを1ステップ拡散に蒸留するワールドアクションモデルVLA2026/9/14
動画生成ベースのロボット操作モデルを1ステップ拡散に蒸留し、把持器と対象物のインタラクションを保ちつつ推論遅延を削減した手法。
- LPA-CWM:反事実世界モデルによる運動推論のための学習型物理判定器運動推論/世界モデル2026/9/12
動画予測モデルから反事実的な介入で運動を抽出する際、複数の候補応答を軽量な学習型判定器で重み付け統合し、信頼性の高い運動推定を実現した研究。
- DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル巧みな操作/VLA/触覚2026/9/8
接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- SLIM-0.5B: ロボット操作のための行動基盤予測潜在表現の学習操作2026/8/1
小型の0.5Bパラメータの潜在相互作用ポリシーを提案し、行動に基づく予測潜在表現を自己教師ありで学習することで、大規模VLAモデルと同等以上の性能を少ないパラメータで達成した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニングVLA/強化学習2026/6/1
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現VLA/能動的知覚/操作2026/3/1
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
- 信頼できる視覚-言語-行動モデルのための行動誤差分布の再形成VLA2026/2/1
連続行動VLAモデルの学習に最小誤差エントロピー(MEE)目的関数を導入し、MSEと組み合わせることで成功率とロバスト性を向上させた研究。
- AnyTouch 2: 動的触覚知覚のための汎用光学触覚表現学習触覚2026/2/1
大規模階層型触覚データセットToucHDを構築し、物体理解と力覚を伴う微細な動的知覚を統合する汎用触覚表現学習フレームワークAnyTouch 2を提案した。
- 潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測VLA2026/2/1
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
- AoE: 身体性AIのための常時オンの一人称視点人間動画収集システムデータ収集2026/2/1
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- Action-Sketcher: 視覚スケッチを介した長期的ロボット操作のための推論から行動へVLA2026/1/1
ロボットの視界に点・箱・矢印・関係を描く「視覚スケッチ」を中間表現として導入し、See-Think-Sketch-Actのサイクルで長期的な操作を実現するVLAフレームワークを提案。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- Robo-Dopamine: 高精度ロボットマニピュレーションのための汎用プロセス報酬モデリングマニピュレーション2025/12/1
多視点入力から段階的な進捗を理解する汎用報酬モデルを3400時間超のデータで学習し、理論的に整合した報酬整形で強化学習によるロボット操作を高精度化した。
- PIGEON: VLM駆動の関心点選択による物体ナビゲーション物体ナビゲーション2025/11/1
VLMを関心点(PoI)の選択に用いることで、未見屋内環境での物体ナビゲーションを効率的かつ検証可能にし、ゼロショットで最先端性能を達成した研究。
- METIS: 多源自己中心データによる統合型巧みな視覚-言語-行動モデルの事前学習VLA2025/11/1
人間とロボットの自己中心視点データを統合した大規模データセットEgoAtlasと動作表現を用いて、巧みな操作のための視覚-言語-行動モデルを事前学習し、実世界タスクでの成功率と汎化性能を向上させた。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論VLA2025/10/1
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
- OmniSAT: コンパクトな行動トークンによる高速自己回帰VLAVLA2025/10/1
行動をBスプライン符号化と多段残差量子化で圧縮トークン化し、自己回帰型VLAの系列長を6.8倍短縮して学習効率を高める手法を提案。
- NavA³: あらゆる指示を理解し、どこへでも移動し、何でも見つけるナビゲーション2025/8/1
高レベルな人間の指示を理解し、実環境で空間認識を伴う物体ナビゲーションを行う階層型フレームワークNavA³を提案。大規模データで訓練したモデルにより、オープンボキャブラリな物体特定と精密な移動を実現した。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- RoboOS: クロスエンボディメントとマルチエージェント協調のための階層型具現化フレームワークマルチエージェント協調2025/5/1
脳と小脳の階層アーキテクチャに基づき、異なる身体を持つロボット間の協調と長期タスクの計画・実行を可能にするオープンソースの具現化システムを提案。
- AffordGrasp: 雑然環境におけるオープンボキャブラリなタスク指向把持のための文脈内アフォーダンス推論把持2025/3/1
視覚言語モデル(VLM)の推論能力を活用し、暗黙の指示からタスクを推論して対象物体とその部位レベルのアフォーダンスを特定し、機能を考慮した把持姿勢を生成するオープンボキャブラリな把持フレームワークを提案。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- 歩行を超えて:多様な状況でのシームレスな義足制御のための膝角度学習義足制御2024/4/1
全身の動きを入力とするTransformerベースの確率的フレームワークを提案し、歩行以外の多様な状況でも高精度に膝角度を推定して義足のシームレスな制御を実現した。