Chao Yu
University of Waterloo
収録論文 47本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 実演不要の成功率報酬学習による汎用ロボット方策強化学習/報酬学習2026/9/27
専門家の実演なしに、方策の試行錯誤から成功率をブートストラップで学習し、汎用ロボット方策の強化学習を効率化する手法を提案。
- ヒューマノイドバドミントン:限られた人間動作データからの動的ラケットスキル学習マニピュレーション2026/9/25
三段階の階層型強化学習により、限られた人間のバドミントン動作データからヒューマノイドがフォアハンド・バックハンド・ジャンプ返球などの動的ラケットスキルを獲得し、実機で人間とのラリーを実現した。
- 包括的な車両性能のための学習エージェントベースモデル予測制御制御2026/9/10
エージェントベースモデル予測制御にガウス過程回帰による学習を組み合わせ、未知の寄与を予測しながら車両の統合性能を高めるハイブリッド制御手法を提案した。
- AgilePE: 自己対戦強化学習による自律UAV追跡・回避強化学習/UAV2026/8/14
自己対戦強化学習を用いて、UAVの追跡・回避行動をエンドツーエンドで学習し、シミュレーションから実機へのゼロショット転送を実現したシステムを提案する。
- LAMP: 潜在運動事前分布による実世界での器用な手操作学習のガイドマニピュレーション2026/7/1
高次元の手の動作を扱う実世界学習の不安定さを解決するため、潜在運動事前分布モジュールを導入し、模倣学習とオンライン強化学習を組み合わせた3段階の学習フレームワークを提案。実ロボット4タスクで高い成功率を達成。
- ハーネスVLA:メモリ誘導エージェントによる凍結VLAの信頼性ある操作プリミティブへの変換VLA/操作2026/7/1
凍結したVLAモデルを再試行可能な接触豊富なプリミティブとして活用し、解析的プリミティブと組み合わせることで、微調整なしに分布外の操作タスクでの成功率を大幅に向上させるフレームワークを提案した。
- LaWAM: 効率的なダイナミクス認識ロボットポリシーのための潜在世界行動モデルVLA2026/6/1
ロボットの行動がシーンをどう変えるかを予測する潜在空間の世界モデルを導入し、ピクセル単位の動画生成を避けつつ、高成功率と低遅延を実現した。
- STEAM: 実世界ロボット学習のための自己教師あり時間アンサンブル優位性モデリングロボット学習2026/6/1
専門家のデモからフレーム間の時間オフセットを自己教師ありで学習し、ロールアウトデータの各フレームの優位性を評価する手法を提案。混合品質データの保守的なスコアリングにより、ポリシー学習の成功率を向上させた。
- UMI-Bench 1.0: UMIデータを用いた卓上ロボット操作のためのオープンで再現可能な実世界ベンチマークマニピュレーション2026/6/1
UMIスタイルの操作ポリシーを実世界で標準評価する初のベンチマークを提案し、データ収集から評価までの統一プロトコルを提供する。
- VISTA: UMIデータの視覚基盤と物理検証によるVLAトレーニング適応VLA2026/6/1
UMIデータをVLAモデルの訓練に使う際の視覚的・物理的な不整合を解消するため、魚眼カメラ用VQAデータセットと物理検証パイプラインを導入し、実ロボット成功率を向上させた。
- StreamingVLA: アクションフローマッチングと適応的早期観察によるストリーミング型視覚言語行動モデルVLA2026/3/1
VLAモデルの推論遅延を、アクション生成と実行、観察を非同期に並列化するストリーミング方式で削減し、実行の流暢性を向上させた。
- HALO: 重負荷人型アジャイル動作スキルのための微分可能シミュレーションによるSim-to-Realギャップ解消sim2real2026/3/1
未知のペイロードを運ぶ人型ロボットのシミュレーションから実機への転移を改善するため、微分可能シミュレータを用いた2段階のシステム同定フレームワークを提案し、ゼロショット転移を実現した。
- USER: 実世界オンライン方策学習のための統合拡張可能システム実世界オンライン学習/システム2026/2/1
実世界のロボット群をGPUと同様に扱うハードウェア抽象化と非同期学習基盤を提供し、オンライン模倣・強化学習やVLAモデルを長期実験で効率的に訓練できるシステムを構築した。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- 模倣を超えて:VLAモデルのための強化学習ベースのSim-Real協調学習VLA2026/2/1
実機とシミュレーションのデモでSFT後、シミュレーションで強化学習しつつ実機データの補助損失で忘却を防ぐ協調学習フレームワークを提案し、実機卓上操作タスクで成功率と汎化性能を向上させた。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- テスト時スケーリングの拡張:文脈・バッチ・ターンによる3次元視点推論/テスト時スケーリング2025/11/18
推論モデルのテスト時スケーリングを、文脈長・並列サンプリング・反復自己改善の3次元に拡張する枠組みを提案し、難問ベンチマークやヒューマノイド制御への有効性を示した。
- π_RL: フローベース視覚言語行動モデルのオンライン強化学習ファインチューニングVLA2025/10/29
フローマッチングに基づく大規模VLAモデルに強化学習を適用するため、Flow-NoiseとFlow-SDEの2手法を提案し、分布内外で性能を向上させた。
- RLinf-VLA:視覚言語行動モデルの強化学習のための統合効率フレームワークVLA2025/10/1
多様なVLAモデルとRLアルゴリズム、シミュレータを統合し、効率的な強化学習を可能にするフレームワークを提案。LIBEROやManiSkillなどで高い成功率を達成。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- JuggleRL: 深層強化学習によるクアッドロータのボールジャグリング習得sim2real2025/9/1
クアッドロータにラケットを搭載し、深層強化学習でボールジャグリングを実現した研究。シミュレーションで学習した方策を実機にゼロショット転移し、平均311回・最大462回の連続ヒットを達成した。
- SAC Flow: 速度再パラメータ化逐次モデリングによるフローベース方策のサンプル効率の良い強化学習強化学習2025/9/1
フローベース方策のオフポリシー強化学習における不安定性を、速度ネットワークの再パラメータ化とゲート機構で解決し、SACベースの実用的アルゴリズムを提案した。連続制御とロボットマニピュレーションで最先端性能を達成。
- D3P: 強化学習による動的デノイジング拡散ポリシーVLA2025/8/1
拡散ポリシーの推論時、各行動に必要なデノイジングステップ数を状態に応じて動的に割り当てる軽量アダプタを強化学習で最適化し、成功率を維持しつつ最大2.2倍の高速化を実現した。
- Spec-VLA:緩和された受理基準による視覚-言語-行動モデルの投機的デコーディングVLA2025/7/30
視覚-言語-行動モデルの推論を高速化するため、行動トークン間の相対距離を利用して受理基準を緩和した投機的デコーディングフレームワークを提案し、成功率を維持しつつ1.42倍の高速化を実現した。
- RLはVLAの汎化に何をもたらすか?実証研究VLA2025/5/26
VLAモデルの汎化性能を評価するベンチマークを構築し、RL微調整(特にPPO)がSFTより意味理解と実行頑健性を大幅に向上させることを示した実証研究。
- ReinFlow: フローマッチング方策をオンライン強化学習で微調整強化学習2025/5/1
フローマッチング方策に学習可能なノイズを注入して離散マルコフ過程に変換し、オンライン強化学習で微調整する手法を提案。歩行・操作タスクで大幅な性能向上と計算時間削減を実現。
- 四足歩行ロボットチームによる実世界での協調・競争サッカーに向けてマルチエージェント強化学習2025/5/1
階層型マルチエージェント強化学習により、四足歩行ロボットが自律的に協調・競争サッカーを行うフレームワークを提案し、実機でロボット同士や人間との試合を実現した。
- ヒステリシスを考慮したニューラルネットワークモデリングと全身強化学習によるソフトロボット制御ソフトロボティクス/強化学習2025/4/1
軟質材料のヒステリシスを考慮した全身NNモデルを構築し、強化学習で全身制御方策を学習。ファントム実験で高精度な軌道追従を実現した。
- 未知環境における協調探査のためのマルチロボットシステム:サーベイ群制御2025/3/1
未知の大規模環境での協調探査を実現するマルチロボットシステムについて、自己位置推定・地図統合、協調行動計画、通信制約などの構成要素を体系的に整理したサーベイ論文。
- VolleyBots:運動制御と戦略的プレーを統合したマルチドローン・バレーボール競技のテストベッド群制御2025/2/1
複数ドローンがバレーボールで協調・対戦するテストベッドを構築し、運動制御と戦略を組み合わせたタスクで強化学習やゲーム理論の手法を評価した。階層型方策が3対3で69.5%の勝率を達成し、シミュレーションから実機へのゼロショット転移も示した。
- 非最適データからの連続制御学習:自己回帰ソフトQネットワーク強化学習2025/2/1
連続制御の強化学習において、Q値を粗から細への自己回帰的にモデル化し、非専門家のデモやオンラインデータなどの非最適データからでも効率的に学習できるARSQを提案した。
- クアッドロータ制御のためのゼロショットSim-to-Real強化学習ポリシー学習で重要な要素とは?包括的調査sim2real2024/12/1
クアッドロータの強化学習制御において、実機にゼロショットで展開するために重要な5つの要素を特定し、PPOベースのSimpleFlightを開発。従来手法より軌道追従誤差を50%以上削減した。
- ニューラル内部モデル制御:予測誤差フィードバックによるロバスト制御方策の学習sim2real2024/11/1
剛体力学のニューラル内部モデルと予測誤差フィードバックを強化学習に統合し、外乱に強い閉ループ制御を実現。ドローンや四足歩行ロボットで高性能を示し、実機移行も成功。
- 強化学習による静的・動的障害物回避を伴うマルチUAV編隊制御群制御2024/10/1
2段階の強化学習パイプラインと注意機構エンコーダ、カリキュラム学習を用いて、複数UAVの編隊維持と静的・動的障害物回避を両立させる手法を提案し、実機実験で有効性を示した。
- 深層強化学習による未知環境でのマルチUAV追跡逃避のオンライン計画群制御2024/9/1
深層強化学習を用いて、未知環境で複数のUAVが協調して逃避者を追跡・捕獲するための方策を学習し、実機のクアッドロータにゼロショットで展開した研究。
- ハミルトン制約付き社会ナビゲーションのための人・ロボット協調分布カップリング社会ナビゲーション2024/9/1
ポート・ハミルトン系と拡散モデルを組み合わせ、人間の不確実性と社会的規範を考慮したロボットの対人ナビゲーション手法NaviDIFFを提案。
- FlightBench:自己視点ドローンのナビゲーションにおける学習ベース手法のベンチマークナビゲーション2024/6/1
自己視点ドローンのナビゲーションについて、学習ベース手法と最適化ベース手法を様々な難易度のシーンで比較評価する初の包括的ベンチマークを構築し、実環境での検証も行った。
- 大規模言語モデルを用いた四足歩行ロボットの長期的な移動と操作VLA2024/4/1
大規模言語モデルを活用し、四足歩行ロボットが長期的なタスクを計画・実行するシステムを構築した。強化学習による運動・操作スキルと組み合わせ、道具の作成や人間への助け要請などの複雑な行動を実現した。
- MASP: Scalable GNN-based Planning for Multi-Agent Navigation2023/12/1
- Active Neural Topological Mapping for Multi-Agent Exploration2023/11/1
- OmniDrones: An Efficient and Flexible Platform for Reinforcement Learning in Drone Control2023/9/1
- LAGOON: Language-Guided Motion Control2023/6/1
- Safe Offline Reinforcement Learning with Real-Time Budget Constraints2023/6/1
- Learning Graph-Enhanced Commander-Executor for Multi-Agent Navigation2023/2/1
- Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration2023/1/1
- Multi-Agent Vulnerability Discovery for Autonomous Driving with Hazard Arbitration Reward2021/12/1
- DS-SLAM: A Semantic Visual SLAM towards Dynamic Environments2018/9/1