Dongbin Zhao
Institute of Automation, Chinese Academy of Sciences
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LocoWM: 世界モデル誘導型残差適応による高精度歩行制御歩行2026/9/30
行動条件付き世界モデルで将来の身体状態を予測し、その予測に基づく残差アダプタで先回りして行動を補正することで、高精度な歩行制御を実現するフレームワークを提案。
- GIFT: 行動指向の構造的監督による誘導中間特徴学習を用いたロボット操作マニピュレーション2026/9/3
視覚と言語の事前学習で得られる特徴と制御に必要な情報の乖離(行動十分性ギャップ)を埋めるため、中間特徴に幾何・アフォーダンス・目標領域の3つの制御関連構造を学習させるフレームワークGIFTを提案し、複数のポリシーで性能向上を確認した。
- VT-WAM: 接触を伴う操作のための視覚-触覚ワールドアクションモデルマニピュレーション2026/7/1
接触を伴う操作タスク向けに、視覚予測・触覚変形予測・行動予測を統合したフレームワークを提案し、実世界6タスクで高い成功率を達成した。
- WALA: 行動ラベル付きデモと行動フリー動画から実行可能な潜在行動を学習するロボット学習2026/7/1
行動ラベル付きデモと行動フリー動画の両方から実行可能な潜在行動を学習するフレームワークWALAを提案し、ロボットポリシーの性能と汎化性を向上させた。
- ConsistencyPlanner: 高速サンプリング整合性モデルによるリアルタイムプランニング自動運転プランニング2026/6/1
自動運転の閉ループプランニングを高速化するため、整合性モデルを用いた多様な軌道生成と注意機構による特徴統合を提案し、Waymaxシミュレータで安全性を向上させた。
- X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデルVLA2026/5/1
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
- クリップ付き目的関数による後方最適化:生成的方策学習における効率と安定性の橋渡しロボット操作/強化学習2026/4/1
ロボット操作のための生成的方策をRLで微調整する際の不安定性とサンプル非効率を解決するため、後方推論として方策改善を定式化するPOCOフレームワークを提案。期待値最大化手順で報酬重み付き暗黙後方を方策に蒸留し、オフラインからオンラインへのパラダイムで事前分布に探索を固定する。
- 失敗から学ぶ:テイクオーバーデータを用いた運転VLAのポストトレーニング自動運転/VLA2026/3/1
自動運転のVLAモデルに対し、テイクオーバー(人間介入)データを活用した新しいポストトレーニング手法TakeVLAを提案。介入前の言語指示とシナリオ再構築による強化学習で安全マージンを拡大し、ベンチマークで最高性能を達成した。
- 潜在世界行動モデリングによるエンドツーエンド自動運転自動運転2026/3/1
空間認識と動力学を考慮した潜在世界表現を用いた効率的なエンドツーエンド自動運転フレームワークを提案し、軌道計画性能を向上させた。
- PerlAD: 擬似シミュレーションに基づく強化学習による閉ループエンドツーエンド自動運転の性能向上自動運転2026/3/1
オフラインデータから構築したベクトル空間上の擬似シミュレーションと予測ワールドモデルを用いて、レンダリング不要で効率的な強化学習による閉ループ自動運転を実現した。
- DreamerAD: 潜在世界モデルによる自動運転のための効率的な強化学習自動運転/世界モデル2026/3/1
動画拡散モデルのサンプリングを100ステップから1ステップに圧縮し80倍高速化した潜在世界モデルで、自動運転の強化学習を安全かつ高頻度に訓練可能にした。
- 長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習VLA2026/2/1
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- 生成的エピソードガイダンスによる二重粒度コントラスト報酬で効率的な身体性RL強化学習/報酬設計2026/2/1
大規模動画生成モデルを活用し、少数の専門家動画から各RLエピソード用のタスクガイダンスを生成して、粗い探索と細かいマッチングを両立する二重粒度コントラスト報酬を与えることで、人手アノテーションなしにサンプル効率の高い身体性強化学習を実現した研究。
- InCoM: 意図駆動型知覚と構造的協調による移動マニピュレーション移動マニピュレーション2026/2/1
移動マニピュレーションにおいて、潜在的な動作意図を推定して知覚注意を段階的に配分し、ベースとアームの動作を分離して協調生成するフレームワークを提案。シミュレーションと実機で成功率を大幅に向上させた。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- TakeAD: 専門家の介入データを用いた選好ベースの事後最適化によるエンドツーエンド自動運転自動運転2025/12/1
自動運転の模倣学習における開ループ訓練と閉ループ運用のギャップを埋めるため、ドライバー介入データを活用しDAggerとDPOを組み合わせて方策を微調整する手法を提案した。
- Mimir: 不確実性伝播を伴う階層的目標駆動拡散によるエンドツーエンド自動運転自動運転2025/12/1
目標点の不確実性をラプラス分布で推定し、マルチレート誘導機構で先読みすることで、堅牢かつ高速な軌道生成を実現した階層型自動運転フレームワーク。
- DiffuDepGrasp: 拡散モデルによる深度ノイズモデリングで実現するSim2Realロボット把持sim2real2025/11/1
拡散モデルで実機深度センサのノイズを学習・合成し、シミュレーションのみで訓練した把持方策をゼロショットで実機に転移するフレームワークを提案。
- QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデルVLA2025/10/1
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- 逐次ワールドモデルによるマルチロボット協調の実現マルチロボット協調2025/9/1
各エージェントが先行エージェントの予測に基づいて自己のワールドモデルを逐次的に構築・計画するSeqWMを提案し、マルチロボット協調タスクで高性能とサンプル効率を達成、実機四足ロボットにも適用した。
- 身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイVLA2025/8/1
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
- CLAR: マスク再構成と多段階コントラスト整合を融合したロボットマニピュレーション向け3D表現学習マニピュレーション2025/7/1
マスク付きオートエンコーダとクロスモーダルなコントラスト学習を組み合わせ、局所的な変形可能注意で3D形状と2D視覚特徴を精密に対応付ける3D事前学習フレームワークを提案し、視覚運動ポリシー学習で最高性能を達成した。
- ReasonPlan:閉ループ自動運転のための統合シーン予測と意思決定推論自動運転2025/5/1
マルチモーダル大規模言語モデルを微調整し、次シーン予測と意思決定連鎖推論を組み合わせて閉ループ自動運転の性能と解釈性を向上させた研究。
- TeViR: 拡散モデルによるテキストから動画への報酬生成で効率的な強化学習強化学習/ロボットマニピュレーション2025/5/1
テキストから動画を生成する拡散モデルを使い、予測映像と現在の観測を比較して密な報酬を生成する強化学習手法を提案。11の複雑なロボット操作タスクでサンプル効率と性能を向上させた。
- オンラインマップの不確かさを活用した安全なエンドツーエンド自動運転自動運転2025/4/1
知覚モジュールでオンラインマップの不確かさを見積もり、その不確かさを予測・計画・軌道選択に活用することで、衝突率を最大26%削減する手法UncADを提案した。
- FetchBot: ゼロショットSim2Realによる散らかったシーンでの汎化可能な物体把持sim2real2025/2/1
100万シーンの合成データと50万のデモを用い、RGBから深度を予測して遮蔽物を考慮した行動生成を行うSim2Realフレームワーク。実環境の散らかった場面で平均89.95%の成功率を達成した。
- ConRFT: 一貫性ポリシーによるVLAモデルの強化学習ファインチューニングVLA2025/2/1
VLAモデルをオフラインとオンラインの強化学習でファインチューニングし、実世界の接触を伴う操作タスクで成功率を大幅に向上させた手法。
- 予測的個別世界モデルによる夢から運転へ自動運転/モデルベースRL2025/1/1
各車両の意図と相互作用を捉える個別レベルの世界モデルを構築し、その想像内で運転方策を学習することで、複雑な都市環境での安全で効率的な自動運転を実現した。
- 模倣学習ベースのエンドツーエンド自動運転におけるデータスケーリング則自動運転2024/12/1
400万件の運転デモデータを用いて、模倣学習ベースのエンドツーエンド自動運転モデルの性能がデータ量に対してべき乗則に従うことを示し、長尾データの重要性や組み合わせ汎化を明らかにした。
- 単峰確率分布による連続行動空間の離散化:オンポリシー強化学習のための手法強化学習2024/8/1
連続行動空間をポアソン分布で単峰的に離散化する方策を提案し、オンポリシー強化学習の収束速度と性能を向上させた。
- PlanAgent: マルチモーダル大規模言語モデルによる閉ループ車両運動計画自動運転計画2024/6/1
マルチモーダルLLMを認知エージェントとして用い、BEV地図とテキスト記述から階層的推論でプランナコードを生成し、反省モジュールで評価する閉ループ車両運動計画システムを提案。nuPlanで評価。
- LLMによる物体親和性転移で物体ゴールナビゲーションを進化させるナビゲーション2024/3/1
LLMから得た意味知識と学習ベースの物体親和性を動的に融合し、未知環境での物体ゴールナビゲーションの汎化性能を高めるフレームワークLOATを提案した。
- RoboGPT: an intelligent agent of making embodied long-term decisions for daily instruction tasks2023/11/1
- ComSD: Balancing Behavioral Quality and Diversity in Unsupervised Skill Discovery2023/9/1
- Planning-inspired Hierarchical Trajectory Prediction for Autonomous Driving2023/4/1
- NeuronsMAE: A Novel Multi-Agent Reinforcement Learning Environment for Cooperative and Competitive Multi-Robot Tasks2023/3/1
- Cross-domain Random Pre-training with Prototypes for Reinforcement Learning2023/2/11
- NeuronsGym: A Hybrid Framework and Benchmark for Robot Tasks with Sim2Real Policy Learning2023/2/1
- Conditional Goal-oriented Trajectory Prediction for Interacting Vehicles with Vectorized Representation2022/10/1
- TrajGen: Generating Realistic and Diverse Trajectories with Reactive and Feasible Agent Behaviors for Autonomous Driving2022/3/1
- Multi-task Safe Reinforcement Learning for Navigating Intersections in Dense Traffic2022/2/1
- A Reinforcement Learning Benchmark for Autonomous Driving in Intersection Scenarios2021/9/1
- Deep Reinforcement Learning based Automatic Exploration for Navigation in Unknown Environment2020/7/1
- Lane Change Decision-making through Deep Reinforcement Learning with Rule-based Constraints2019/4/1