Donglin Wang
Alibaba Group
収録論文 74本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- PreferenceFlow: 人間介入によるフローマッチングロボット方策のテスト時ガイダンスVLA2026/9/29
人間の介入とロボットの行動を比較して選好モデルを学習し、報酬なしで事前学習済みフローマッチング方策をテスト時に誘導する手法を提案。実機の精密挿入タスクで成功率を69%から90.5%に向上させた。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- GAE: リアルタイムヒューマノイド遠隔操作のための汎用行動エキスパート遠隔操作2026/9/28
多様な人間動作データを活用し、遅延を考慮した予測機構を備えた二段階学習により、ヒューマノイドの全身遠隔操作を低遅延で実現するフレームワークを提案。
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- DAGR: 状態条件付き目標表現と差分認識型目標クロスアテンション強化学習2026/7/15
目標条件付き強化学習において、現在の状態を考慮しない従来の目標表現を、マルチスケールのゲート付きクロスアテンションで状態条件付きに改良する手法DAGRを提案した。ナビゲーションタスクで性能が向上するが、操作やパズルではベースラインと同等以下であり、普遍的な改善ではないことを示した。
- 解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデルVLA2026/7/1
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
- GDPR準拠の軌道共有:ISAC支援ロボットナビゲーションにおけるFID制約付き衝突予測のケーススタディナビゲーション2026/7/1
ISAC環境でのロボット衝突回避において、Fisher情報量密度に基づき軌道データを摂動させて共有する手法を提案し、GDPRのデータ最小化と完全性要件を満たしつつ、プライバシーとユーティリティのトレードオフを改善することを実証した。
- 分析的概念中心メモリによるエージェント型身体操作マニピュレーション2026/6/1
長期的な身体操作タスクのために、物体の状態やスキルを構造化された概念で記憶・検索するメモリフレームワークを提案し、タスク成功率や汎化性能を向上させた。
- CUBic: 協調型統一バイマニュアル知覚・制御フレームワークバイマニュアル操作2026/5/1
両腕ロボットの操作を統一的な知覚モデリング問題として捉え、共有トークン表現と拡散ポリシーにより腕の独立性と協調を構造的に実現するフレームワークを提案した。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- 世界-価値-行動モデル:視覚言語行動システムのための暗黙的プランニングVLA2026/4/1
視覚言語行動(VLA)モデルに、将来の軌跡の潜在表現を学習し、価値関数で評価することで暗黙的プランニングを可能にする統一フレームワークを提案した。
- SwarmDrive: 遅延制約のある協調自動運転のための意味的V2V連携協調自動運転2026/4/1
近隣車両が小型言語モデルで意図を共有し、不確実性が高い時のみイベント駆動で合意形成するV2V協調フレームワークを提案し、交差点の遮蔽シナリオで成功率と遅延を改善した。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- NFPO: 正規化フローによるロボットポリシー学習の安定化ポリシー最適化強化学習2026/3/1
ロボットの強化学習で、多峰性分布を表現できる正規化フローをポリシーとして用いる際の訓練不安定性を分析し、簡単な手法で安定化させて性能を向上させた。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- CMR: 収縮写像埋め込みによる不整地でのロバストなヒューマノイド歩行歩行2026/2/1
観測ノイズに強い潜在表現を学習する収縮写像埋め込み(CMR)を提案し、不整地でのヒューマノイド歩行をロバスト化した研究。
- CRL-VLA:継続的視覚-言語-行動学習VLA2026/2/1
VLAモデルの継続的な強化学習微調整において、安定性と可塑性のトレードオフを非対称な制御と二重クリティック構造で解決するフレームワークを提案。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- 深層強化学習によるヒューマノイドロボットの自己保護転倒ポリシーの発見強化学習2025/12/1
深層強化学習とカリキュラム学習を用いて、ヒューマノイドロボットが転倒時に自己保護するためのポリシーを学習させ、三角形の姿勢を形成することで損傷を大幅に低減できることを発見し、実機に転移した。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- RobustVLA: 視覚言語行動モデルのためのロバスト性を考慮した強化学習ポストトレーニングVLA2025/11/1
事前学習済みVLAモデルに対し、ヤコビアン正則化と平滑化正則化を組み込んだオンライン強化学習ポストトレーニングを行い、観測ノイズや行動摂動に対するロバスト性を高める手法を提案した。
- 効率的な視覚運動学習のためのL1サンプルフロー模倣学習2025/11/1
フローマッチングの多峰性を保ちつつ、L1回帰の効率性を活かすため、2ステップでサンプリングするL1 Flowを提案し、模倣学習ベンチマークで有効性を示した。
- 統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデルVLA2025/11/1
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
- Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメントVLA2025/10/1
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
- VLMの洞察と精密マニピュレーションを繋ぐ実行可能な解析概念マニピュレーション2025/10/1
VLMの高レベル推論を、数学的に定義された「実行可能な解析概念」を介して把持姿勢や力方向・軌道計画に変換し、未学習の物体でも精密操作を可能にするフレームワークGRACEを提案。
- VCoT-Grasp: 視覚的思考連鎖推論による言語駆動型把持生成のための把持基盤モデルマニピュレーション2025/10/1
視覚的思考連鎖推論を組み込んだエンドツーエンドの把持基盤モデルを提案し、大規模データセットを構築して、実環境での把持成功率と未知物体への汎化性能を向上させた。
- VLA^2: エージェントフレームワークで視覚言語行動モデルを強化し未知の概念操作を実現VLA2025/10/1
OpenVLAを実行基盤とし、Web検索や物体検出などの外部モジュールを活用して未知物体の視覚・言語知識を補完するエージェントフレームワークを提案。LIBERO環境での新ベンチマークで、ハードレベル成功率を44.2%向上させた。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニングVLA2025/10/1
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
- TrajBooster: 軌道中心学習によるヒューマノイド全身マニピュレーションの強化VLA2025/9/1
車輪型ヒューマノイドの豊富なデータを活用し、エンドエフェクタ軌道を形態非依存のインターフェースとして二足歩行ヒューマノイドのVLAを効率的に学習させるフレームワークを提案。
- 反力制御と歩容制御の分離による動的適応型脚式ロコモーション方策歩行2025/9/1
強化学習による脚式ロコモーションにおいて、支持脚制御と遊脚制御を分離する枠組みを提案し、未知環境へのオンライン適応とsim-to-realギャップの低減を実現した。
- 軌道最適化と強化学習を統合した不整地適応着地を伴う四脚ロボットの跳躍歩行2025/9/1
軌道最適化で生成した参照動作を強化学習で追従させ、不整地でも安全に着地できる四脚ロボットの跳躍フレームワークを提案した。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- Koopmanガイド付き動力学モデリングによるロバストなオンライン残差修正模倣学習2025/9/1
模倣学習の残差方策にKoopman作用素で学習した潜在空間の大域的動力学を組み込み、長期タスクや未知環境でも安定して高精度に修正できるKORRを提案した。
- 信号と分散のバランス:VLAフローモデルのための適応的オフラインRLポストトレーニングVLA2025/9/1
フローマッチングベースのVLAモデルに対し、バイアスと分散のトレードオフを適応的に制御するオフラインRL微調整法ARFMを提案し、実世界タスクでの性能向上を実現した。
- 境界から領域への監督によるオフライン安全強化学習安全強化学習2025/9/1
オフライン安全RLにおいて、コスト信号を固定予算下の境界制約として再定義し、非対称な条件付けを可能にするB2Rフレームワークを提案。38タスク中35で安全制約を満たしつつ高い報酬を達成した。
- ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚VLA2025/8/1
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
- Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデルVLA2025/8/1
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
- スキルグラフによるマルチタスク・マルチエージェント強化学習マルチエージェント強化学習2025/7/1
無関係なタスクを含むマルチタスク・マルチエージェント強化学習に対し、上位層にスキルグラフ、下位層に標準MARLを用いる階層的手法を提案し、知識転移能力を高めた。
- CEED-VLA: 早期終了デコーディングを備えた一貫性視覚-言語-行動モデルVLA2025/6/1
視覚-言語-行動モデルの推論を高速化するため、一貫性蒸留と早期終了デコーディングを導入し、4倍以上の加速を実現した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化VLA2025/5/1
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
- オフライン事前学習済み方策のみを用いた効率的なオンラインRLファインチューニング強化学習2025/5/1
事前学習済みQ関数に頼らず、オフラインで学習した方策だけを使ってオンライン強化学習でファインチューニングする手法PORLを提案し、BC方策の直接改善も可能にした。
- オープンエンドなマルチモーダル指示で視覚-言語-行動モデルの可能性を解き放つVLA2025/5/1
言語だけでなく画像・手書き文字・動画などの多様な指示を入力できるVLAモデルOE-VLAを提案し、従来の言語指示と同等以上の性能と4種類の追加タスクでの有効性を示した。
- ReinboT: 強化学習でロボットの視覚言語マニピュレーションを強化VLA2025/5/1
模倣学習ベースの視覚言語行動モデルに強化学習の累積報酬最大化を取り入れ、高密度リターン予測で混合品質データから頑健な操作方策を学習する手法を提案。
- MoRE: 四足歩行ロボットの視覚-言語-行動モデルにおける強化学習のスケーラビリティを解き放つVLA2025/3/1
四足歩行ロボット向けに、複数の低ランク適応モジュールを専門家として組み込んだスパース活性化の混合エキスパート型VLAモデルを提案し、強化学習で混合品質データから効率的に学習することで多様なタスク性能と汎化性を実現した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- 想像上の遷移を用いたロボット政策学習:ロバスト性と最適性のトレードオフの緩和歩行2025/3/1
理想環境で得た最適政策とダイナミクスモデルから想像上の遷移を生成し、それを実演入力として強化学習に組み込む二段階フレームワークを提案。四足歩行の学習において、ドメインランダム化による保守性を抑えつつ、訓練加速・追従誤差低減・分布外ロバスト性向上を実現した。
- 行動クローニングにおける潜在冗長性の再考:ロボットマニピュレーションのための情報ボトルネックアプローチ模倣学習2025/2/1
行動クローニングの潜在表現に含まれる冗長性を情報理論的に定量化し、情報ボトルネック原理を導入することで、ロボットマニピュレーションの性能を向上させる手法を提案した。
- TDMPBC:自己模倣強化学習によるヒューマノイドロボット制御強化学習2025/2/1
強化学習において、タスクに関連する可能性のある軌道を自己模倣することで、ヒューマノイドロボットの制御性能を大幅に向上させるフレームワークSIRLを提案した。
- VLAS: 音声指示によるカスタマイズ可能なロボット操作のための視覚-言語-行動モデルVLA2025/2/1
音声認識をロボット方策モデルに直接統合したエンドツーエンドの視覚-言語-行動モデルVLASを提案し、音声指示によるロボット操作を実現した。
- Humanoid-VLA:視覚統合による汎用人型ロボット制御VLA2025/2/1
言語・自己視点映像・運動制御を統合し、大規模未ラベル動画を自己教師ありで活用することで、物体操作や環境探索をこなす汎用人型ロボット制御フレームワークを提案した。
- GEVRM: 目標表現型ビデオ生成モデルによるロバストな視覚マニピュレーションVLA2025/2/1
内部モデル制御の原理を取り入れ、テキスト誘導のビデオ生成で将来の視覚的目標を生成しつつ、摂動を内部埋め込みとして推定することで、外乱に強い閉ループVLAを実現した研究。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策VLA2024/12/1
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
- DIDI: 拡散モデル誘導によるオフライン行動生成の多様性オフライン強化学習2024/5/23
拡散確率モデルを事前分布として用い、ラベルなしオフラインデータから多様なスキルを学習する手法を提案。
- GeRM: 四足歩行ロボットのためのMixture-of-Expertsを用いた汎用ロボットモデルVLA2024/3/1
オフライン強化学習とTransformerベースのVLAネットワーク、Mixture-of-Experts構造を組み合わせ、四足歩行ロボットのマルチタスク学習を効率化する汎用モデルGeRMを提案。自動収集データセットQUARD-Autoも公開。
- QUAR-VLA: Vision-Language-Action Model for Quadruped Robots2023/12/1
- Unlock Reliable Skill Inference for Quadruped Adaptive Behavior by Skill Graph2023/11/1
- A Real-World Quadrupedal Locomotion Benchmark for Offline Reinforcement Learning2023/9/1
- STRAPPER: Preference-based Reinforcement Learning via Self-training Augmentation and Peer Regularization2023/7/19
- BVIP Guiding System with Adaptability to Individual Differences2023/4/1
- Graph based Environment Representation for Vision-and-Language Navigation in Continuous Environments2023/1/1
- Imitation and Adaptation Based on Consistency: A Quadruped Robot Imitates Animals from Videos Using Deep Reinforcement Learning2022/3/1
- A Transferable Legged Mobile Manipulation Framework Based on Disturbance Predictive Control2022/3/1
- Few-shot Domain Adaptation for IMU Denoising2022/1/1
- Learn Goal-Conditioned Policy with Intrinsic Motivation for Deep Reinforcement Learning2021/4/1
- Visual Perception Generalization for Vision-and-Language Navigation via Meta-Learning2020/12/1