Yu Wang
Tsinghua University
収録論文 89本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboDrop: 局所勾配適合性によるVLA事後学習データのキュレーションVLA2026/9/9
VLAモデルの事後学習データに含まれる誤りを、学習中の局所勾配の適合性を指標に自動で検出・除去するデータキュレーション手法を提案。
- VANTAGE-Bench:視覚言語モデルにおけるインフラAIギャップの評価VLM2026/9/8
固定カメラ映像を用いたインフラAI(物流・交通・スマート空間)向けベンチマークを提案し、17モデルのゼロショット評価でイベント検証や時間定位に最大24点の性能不足があることを示した。
- 停止タイミングの学習:VLAにおける内部クロスアテンション動態を用いた適応的アクションチャンキングVLA/アクションチャンキング2026/9/1
固定長のアクションチャンキングの限界を克服するため、アクションエキスパート内のクロスアテンションのエントロピー上昇を検出し、実行中に動的にチャンク長を調整するトレーニング不要の手法を提案した。
- AgilePE: 自己対戦強化学習による自律UAV追跡・回避強化学習/UAV2026/8/14
自己対戦強化学習を用いて、UAVの追跡・回避行動をエンドツーエンドで学習し、シミュレーションから実機へのゼロショット転送を実現したシステムを提案する。
- スイッチングポリシーによるMDP上の制約付きsc-LTL計画の最適化計画・検証2026/8/1
マルコフ決定過程上で、安全性制約を満たしつつ目的を最大化する最適ポリシーを合成する問題を扱い、スイッチングポリシーが最適解となることを示し、線形計画法で解けるようにした。
- co-safe LTL計画のための厳密なモデルフリーポリシー反復法強化学習/計画2026/8/1
有限マルコフ決定過程におけるco-safe線形時相論理目標に対するモデルフリー強化学習法を提案し、割引代理を用いて非一意性を解消し、割引なしのポリシー評価と貪欲改善により最適ポリシーへの収束を保証する。
- 精度の呪い:高精度ロボット操作におけるデータスケーリング則マニピュレーション2026/7/1
ロボット操作の高精度タスクにおいて、目標精度が限界に近づくほど必要デモ数が超指数関数的に増えるスケーリング則を提案し、その限界精度がシステム全体の特性であることを示した。
- ハーネスVLA:メモリ誘導エージェントによる凍結VLAの信頼性ある操作プリミティブへの変換VLA/操作2026/7/1
凍結したVLAモデルを再試行可能な接触豊富なプリミティブとして活用し、解析的プリミティブと組み合わせることで、微調整なしに分布外の操作タスクでの成功率を大幅に向上させるフレームワークを提案した。
- 動作焦点の潜在アクションによる人間のエゴビデオからのクロスエンボディVLA訓練VLA2026/6/1
ラベルなしの人間のエゴビデオから動作の潜在アクションを抽出し、ロボットのVLAモデルを訓練する手法を提案。シミュレーションと実環境で、わずか50トラジェクトリの適応で大規模データセットで訓練した最先端モデルと同等の性能を達成。
- 人間の動作スタイルを移植するヒューマノイド全身制御のための生体模倣手法全身制御/スタイル転送2026/6/1
短い人間の動作スタイル例から、目標の動作内容を保ちつつスタイルを移植した全身参照動作を生成し、物理実行可能な制御ポリシーでヒューマノイドに実行させる枠組みを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- STEAM: 実世界ロボット学習のための自己教師あり時間アンサンブル優位性モデリングロボット学習2026/6/1
専門家のデモからフレーム間の時間オフセットを自己教師ありで学習し、ロールアウトデータの各フレームの優位性を評価する手法を提案。混合品質データの保守的なスコアリングにより、ポリシー学習の成功率を向上させた。
- Human2Humanoid: ヒューマノイドロボットのための物理認識クロスモルフォロジー動作リターゲティング動作リターゲティング2026/6/1
人間の動作をヒューマノイドロボットに転写するための教師なしリターゲティングフレームワークを提案し、CycleGANと物理制約を組み合わせて高忠実度かつ物理的に実現可能な動作を生成する。
- StreamingVLA: アクションフローマッチングと適応的早期観察によるストリーミング型視覚言語行動モデルVLA2026/3/1
VLAモデルの推論遅延を、アクション生成と実行、観察を非同期に並列化するストリーミング方式で削減し、実行の流暢性を向上させた。
- AsgardBench:最小限のフィードバック下での視覚に基づく対話的プランニングの評価対話的プランニング2026/3/1
視覚に基づく高レベルの行動系列生成と対話的プランニングを評価するベンチマークを提案し、実行中の視覚観察に基づくプラン適応に焦点を当てる。
- 意図と実行のギャップを活用:視覚運動ポリシーにおける暗黙的インピーダンスの学習マニピュレーション2026/2/1
遠隔操作のマスタ指令とスレーブ応答のズレをノイズではなく力覚情報として活用し、意図クローニングにより暗黙的なインピーダンス制御を実現する枠組みを提案した。
- 模倣を超えて:VLAモデルのための強化学習ベースのSim-Real協調学習VLA2026/2/1
実機とシミュレーションのデモでSFT後、シミュレーションで強化学習しつつ実機データの補助損失で忘却を防ぐ協調学習フレームワークを提案し、実機卓上操作タスクで成功率と汎化性能を向上させた。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- USER: 実世界オンライン方策学習のための統合拡張可能システム実世界オンライン学習/システム2026/2/1
実世界のロボット群をGPUと同様に扱うハードウェア抽象化と非同期学習基盤を提供し、オンライン模倣・強化学習やVLAモデルを長期実験で効率的に訓練できるシステムを構築した。
- SKATER: ローラースケートのスウィズル動作による人型ロボットの移動効率向上歩行2026/1/1
各足に4つの受動輪を備えた人型ロボットでローラースケートのスウィズル歩容を深層強化学習により獲得し、従来の二足歩行に比べ衝撃強度と移動コストを大幅に削減した。
- ArtiSG: 人間の実演による関節物体操作を用いた機能的3Dシーングラフ構築シーングラフ2025/12/1
人間の操作実演から6自由度軌跡と関節軸を推定し、開語彙の階層的3Dシーングラフに組み込むことで、隠れた取っ手などの機能要素も発見できるロボット記憶を構築するフレームワーク。
- テスト時スケーリングの拡張:文脈・バッチ・ターンによる3次元視点推論/テスト時スケーリング2025/11/18
推論モデルのテスト時スケーリングを、文脈長・並列サンプリング・反復自己改善の3次元に拡張する枠組みを提案し、難問ベンチマークやヒューマノイド制御への有効性を示した。
- π_RL: フローベース視覚言語行動モデルのオンライン強化学習ファインチューニングVLA2025/10/29
フローマッチングに基づく大規模VLAモデルに強化学習を適用するため、Flow-NoiseとFlow-SDEの2手法を提案し、分布内外で性能を向上させた。
- RLinf-VLA:視覚言語行動モデルの強化学習のための統合効率フレームワークVLA2025/10/1
多様なVLAモデルとRLアルゴリズム、シミュレータを統合し、効率的な強化学習を可能にするフレームワークを提案。LIBEROやManiSkillなどで高い成功率を達成。
- SAC Flow: 速度再パラメータ化逐次モデリングによるフローベース方策のサンプル効率の良い強化学習強化学習2025/9/1
フローベース方策のオフポリシー強化学習における不安定性を、速度ネットワークの再パラメータ化とゲート機構で解決し、SACベースの実用的アルゴリズムを提案した。連続制御とロボットマニピュレーションで最先端性能を達成。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- JuggleRL: 深層強化学習によるクアッドロータのボールジャグリング習得sim2real2025/9/1
クアッドロータにラケットを搭載し、深層強化学習でボールジャグリングを実現した研究。シミュレーションで学習した方策を実機にゼロショット転移し、平均311回・最大462回の連続ヒットを達成した。
- D3P: 強化学習による動的デノイジング拡散ポリシーVLA2025/8/1
拡散ポリシーの推論時、各行動に必要なデノイジングステップ数を状態に応じて動的に割り当てる軽量アダプタを強化学習で最適化し、成功率を維持しつつ最大2.2倍の高速化を実現した。
- 狭い経路を歩行する:ロバストで安全なヒューマノイド歩行のための二段階強化学習フレームワーク歩行2025/8/1
テンプレートベースの足場計画と強化学習を組み合わせた二段階学習で、ヒューマノイドが幅0.2mの狭い梁を安全に歩行できるようにした。
- Spec-VLA:緩和された受理基準による視覚-言語-行動モデルの投機的デコーディングVLA2025/7/30
視覚-言語-行動モデルの推論を高速化するため、行動トークン間の相対距離を利用して受理基準を緩和した投機的デコーディングフレームワークを提案し、成功率を維持しつつ1.42倍の高速化を実現した。
- 部分観測環境における複雑な知覚関連目標のための制御合成制御合成2025/7/1
部分観測マルコフ決定過程で複雑な知覚関連目標を達成するため、sc-iLTLを導入し、信念MDPとDFAの積で到達可能性問題に変換、MCTSで最適方策を求める手法を提案。
- 投げ縄グリッパ:紐の射出・巻き取り機構による形状適応把持マニピュレーション2025/6/1
投げ縄に着想を得て、紐を射出・巻き取ることで大小や繊細な物体を優しく把持できる新型グリッパを開発し、ロボットアームでの把持・運搬実験で有効性を示した。
- RLはVLAの汎化に何をもたらすか?実証研究VLA2025/5/26
VLAモデルの汎化性能を評価するベンチマークを構築し、RL微調整(特にPPO)がSFTより意味理解と実行頑健性を大幅に向上させることを示した実証研究。
- ReinFlow: フローマッチング方策をオンライン強化学習で微調整強化学習2025/5/1
フローマッチング方策に学習可能なノイズを注入して離散マルコフ過程に変換し、オンライン強化学習で微調整する手法を提案。歩行・操作タスクで大幅な性能向上と計算時間削減を実現。
- ヒステリシスを考慮したニューラルネットワークモデリングと全身強化学習によるソフトロボット制御ソフトロボティクス/強化学習2025/4/1
軟質材料のヒステリシスを考慮した全身NNモデルを構築し、強化学習で全身制御方策を学習。ファントム実験で高精度な軌道追従を実現した。
- ヒューマノイドロボットによる微小物体の高精度位置合わせのためのTransformerベース視覚サーボ視覚サーボ2025/3/1
頭部と胴体のカメラ画像と頭部関節角度を融合し、Transformerベースの視覚サーボで手持ち工具と対象物の相対位置を高精度に推定・制御するフレームワークを提案。M4-M8ねじで平均収束誤差0.8-1.3mm、成功率93-100%を達成。
- 未知環境における協調探査のためのマルチロボットシステム:サーベイ群制御2025/3/1
未知の大規模環境での協調探査を実現するマルチロボットシステムについて、自己位置推定・地図統合、協調行動計画、通信制約などの構成要素を体系的に整理したサーベイ論文。
- HEATS: 移動マニピュレータによる効率的な自律目標探索のための階層型フレームワーク移動マニピュレーション2025/3/1
移動マニピュレータの強みを活かした視点計画と全身運動計画を組み合わせ、未知環境での目標探索を効率化する階層型フレームワークを提案した。
- 非最適データからの連続制御学習:自己回帰ソフトQネットワーク強化学習2025/2/1
連続制御の強化学習において、Q値を粗から細への自己回帰的にモデル化し、非専門家のデモやオンラインデータなどの非最適データからでも効率的に学習できるARSQを提案した。
- VolleyBots:運動制御と戦略的プレーを統合したマルチドローン・バレーボール競技のテストベッド群制御2025/2/1
複数ドローンがバレーボールで協調・対戦するテストベッドを構築し、運動制御と戦略を組み合わせたタスクで強化学習やゲーム理論の手法を評価した。階層型方策が3対3で69.5%の勝率を達成し、シミュレーションから実機へのゼロショット転移も示した。
- リソース制約ロボットのためのリアルタイムLiDAR点群圧縮・伝送点群圧縮2025/2/1
リソース制約のあるロボット向けに、点群を反復的な表面フィッティングとSA-DCTで圧縮し、QoEに基づく適応ビットレート制御で伝送するフレームワークRCPCCを提案した。
- MR-COGraphs: 3Dシーングラフによる通信効率の良いマルチロボットオープンボキャブラリマッピングシステムマルチロボットマッピング2024/12/1
物体をノード、空間隣接関係をエッジとする3DシーングラフCOGraphを構築し、特徴圧縮と復元により通信量を80%以上削減しつつ、複数ロボットの地図を統合してオープンボキャブラリなマッピングを実現した。
- クアッドロータ制御のためのゼロショットSim-to-Real強化学習ポリシー学習で重要な要素とは?包括的調査sim2real2024/12/1
クアッドロータの強化学習制御において、実機にゼロショットで展開するために重要な5つの要素を特定し、PPOベースのSimpleFlightを開発。従来手法より軌道追従誤差を50%以上削減した。
- ニューラル内部モデル制御:予測誤差フィードバックによるロバスト制御方策の学習sim2real2024/11/1
剛体力学のニューラル内部モデルと予測誤差フィードバックを強化学習に統合し、外乱に強い閉ループ制御を実現。ドローンや四足歩行ロボットで高性能を示し、実機移行も成功。
- SPF-EMPCプランナ:不確実性を伴う複雑環境向けリアルタイム複数ロボット軌道計画群制御2024/10/1
安全確率場と拡張状態モデル予測制御を組み合わせ、動的障害物や状態観測の不確実性がある複雑環境で複数ロボットをリアルタイムに安全航行させる軌道計画手法を提案した。
- 強化学習による静的・動的障害物回避を伴うマルチUAV編隊制御群制御2024/10/1
2段階の強化学習パイプラインと注意機構エンコーダ、カリキュラム学習を用いて、複数UAVの編隊維持と静的・動的障害物回避を両立させる手法を提案し、実機実験で有効性を示した。
- ハミルトン制約付き社会ナビゲーションのための人・ロボット協調分布カップリング社会ナビゲーション2024/9/1
ポート・ハミルトン系と拡散モデルを組み合わせ、人間の不確実性と社会的規範を考慮したロボットの対人ナビゲーション手法NaviDIFFを提案。
- 動物の行動進化に着想を得た四足歩行ロボットの歩容強化学習歩行2024/9/1
動物の運動進化を模倣し、遺伝的アルゴリズムで参照歩容を改良しながら強化学習を繰り返すことで、多様な地形や外乱に適応する四足ロボットの歩容を訓練するフレームワークを提案した。
- 深層強化学習による未知環境でのマルチUAV追跡逃避のオンライン計画群制御2024/9/1
深層強化学習を用いて、未知環境で複数のUAVが協調して逃避者を追跡・捕獲するための方策を学習し、実機のクアッドロータにゼロショットで展開した研究。
- LTL代理報酬に対する動的計画法の収束保証計画/制御2024/8/1
LTL目的を最大化する方策を動的計画法で求める際、割引率が1の場合でも近似価値関数が真値に指数的に収束することを示し、充足確率計算の保証を与えた。
- FlightBench:自己視点ドローンのナビゲーションにおける学習ベース手法のベンチマークナビゲーション2024/6/1
自己視点ドローンのナビゲーションについて、学習ベース手法と最適化ベース手法を様々な難易度のシーンで比較評価する初の包括的ベンチマークを構築し、実環境での検証も行った。
- LTL目的のためのベルマン方程式の解の一意性について強化学習2024/4/1
LTL目的の代理報酬で用いられる2つの割引率を持つベルマン方程式が一意解を持つ条件を明らかにし、棄却BSCC内の状態の解を0とする条件が十分であることを証明した。
- 自己位置推定誤差がUAV飛行に与える影響の定量化UAVナビゲーション2024/3/1
UAVの最大安全飛行速度と自己位置推定誤差などのパラメータの関係をモデル化し、シミュレーションで検証した研究。
- EVI-SAM: Robust, Real-time, Tightly-coupled Event-Visual-Inertial State Estimation and 3D Dense Mapping2023/12/1
- MASP: Scalable GNN-based Planning for Multi-Agent Navigation2023/12/1
- Active Neural Topological Mapping for Multi-Agent Exploration2023/11/1
- Adaptive Tuning of Robotic Polishing Skills based on Force Feedback Model2023/10/1
- Large Trajectory Models are Scalable Motion Predictors and Planners2023/10/1
- OmniDrones: An Efficient and Flexible Platform for Reinforcement Learning in Drone Control2023/9/1
- ClusterFusion: Real-time Relative Positioning and Dense Reconstruction for UAV Cluster2023/4/1
- HybridFusion: LiDAR and Vision Cross-Source Point Cloud Fusion2023/4/1
- Learning Graph-Enhanced Commander-Executor for Multi-Agent Navigation2023/2/1
- Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration2023/1/1
- Edge-based Monocular Thermal-Inertial Odometry in Visually Degraded Environments2022/10/1
- Point Cloud Change Detection With Stereo V-SLAM:Dataset, Metrics and Baseline2022/7/1
- Robotic Computing on FPGAs: Current Progress, Research Challenges, and Opportunities2022/5/1
- Explore-Bench: Data Sets, Metrics and Evaluations for Frontier-based and Deep-reinforcement-learning-based Autonomous Exploration2022/2/1
- Multi-UAV Coverage Planning with Limited Endurance in Disaster Environment2022/1/1
- Multi-Agent Vulnerability Discovery for Autonomous Driving with Hazard Arbitration Reward2021/12/1
- Relative Distributed Formation and Obstacle Avoidance with Multi-agent Reinforcement Learning2021/11/1
- A drl based distributed formation control scheme with stream based collision avoidance2021/9/1
- Tactile Sensing with a Tendon-Driven Soft Robotic Finger2021/7/1
- An Internal Arc Fixation Channel and Automatic Planning Algorithm for Pelvic Fracture2021/7/1
- The Grasps Under Varied Object Orientation Dataset: Relation Between Grasps and Object Orientation2021/6/1
- Reinforcement Learning with Temporal Logic Constraints for Partially-Observable Markov Decision Processes2021/4/1
- Model-Free Learning of Safe yet Effective Controllers2021/3/1
- Learning Optimal Strategies for Temporal Tasks in Stochastic Games2021/2/1
- Secure Planning Against Stealthy Attacks via Model-Free Reinforcement Learning2020/11/1
- DRF: A Framework for High-Accuracy Autonomous Driving Vehicle Modeling2020/11/1
- A Learning-Based Tune-Free Control Framework for Large Scale Autonomous Driving System Deployment2020/11/1
- Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes2020/11/1
- Model-Free Reinforcement Learning for Stochastic Games with Linear Temporal Logic Objectives2020/10/1
- DL-IAPS and PJSO: A Path/Speed Decoupled Trajectory Optimization and its Application in Autonomous Driving2020/9/1
- TDR-OBCA: A Reliable Planner for Autonomous Driving in Free-Space Environment2020/9/1
- A Survey of FPGA-Based Robotic Computing2020/9/1
- Hyperproperties for Robotics: Planning via HyperLTL2019/11/1
- Review of Learning-based Longitudinal Motion Planning for Autonomous Vehicles: Research Gaps between Self-driving and Traffic Congestion2019/10/1
- Control Synthesis from Linear Temporal Logic Specifications using Model-Free Reinforcement Learning2019/9/1
- Recognition of Pyralidae Insects Using Intelligent Monitoring Autonomous Robot Vehicle in Natural Farm Scene2019/3/1