Yi Wu
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ヒューマノイドバドミントン:限られた人間動作データからの動的ラケットスキル学習マニピュレーション2026/9/25
三段階の階層型強化学習により、限られた人間のバドミントン動作データからヒューマノイドがフォアハンド・バックハンド・ジャンプ返球などの動的ラケットスキルを獲得し、実機で人間とのラリーを実現した。
- NavCMPO: 批評家誘導型MeanFlowポリシー最適化による適応的ナビゲーションナビゲーション2026/7/1
拡散ベースのナビゲーションポリシーの推論遅延と模倣学習の限界を克服するため、数ステップのMeanFlow軌道生成と批評家による軌道修正、強化学習による微調整を組み合わせた二段階適応ナビゲーションフレームワークを提案した。
- SoftNav: 3DシーントークンをVLMに注入する身体化ナビゲーションナビゲーション2026/7/1
3Dシーン情報をテキストではなくソフトトークンとしてVLMに直接注入するナビゲーション手法を提案し、少ない学習データで高い性能とゼロショット転移を実現した。
- Action QFormer: 行動監視下での構造化表現形成による視覚言語行動モデルの性能向上VLA2026/7/1
視覚言語行動モデルにおいて、行動監視が継承したマルチモーダル表現を形成する役割を分析し、クエリベースのインターフェースを導入して行動に適した表現を再構成することで、ゼロショットsim-to-realナビゲーションの成功率を大幅に向上させた。
- 知覚・対話・推論:空間推論のためのツール拡張型視覚エージェントの構築視覚エージェント/空間推論2026/6/11
視覚言語モデルの空間推論能力を高めるため、知覚・対話ツールを備えたエージェントPERIAを提案し、マルチツール行動の学習手法とともにその有効性を実証した。
- テスト時スケーリングの拡張:文脈・バッチ・ターンによる3次元視点推論/テスト時スケーリング2025/11/18
推論モデルのテスト時スケーリングを、文脈長・並列サンプリング・反復自己改善の3次元に拡張する枠組みを提案し、難問ベンチマークやヒューマノイド制御への有効性を示した。
- D3P: 強化学習による動的デノイジング拡散ポリシーVLA2025/8/1
拡散ポリシーの推論時、各行動に必要なデノイジングステップ数を状態に応じて動的に割り当てる軽量アダプタを強化学習で最適化し、成功率を維持しつつ最大2.2倍の高速化を実現した。
- 反射的VLM計画による双腕デスクトップ清掃:オープンボキャブラリ知覚と精密マニピュレーションの橋渡しマニピュレーション2025/6/1
VLMが操作手順を生成・批評・修正する階層的枠組みと双腕ロボットを組み合わせ、机上の多様なゴミをオープンボキャブラリで認識して清掃するシステムを提案した。
- RLはVLAの汎化に何をもたらすか?実証研究VLA2025/5/26
VLAモデルの汎化性能を評価するベンチマークを構築し、RL微調整(特にPPO)がSFTより意味理解と実行頑健性を大幅に向上させることを示した実証研究。
- 四足歩行ロボットチームによる実世界での協調・競争サッカーに向けてマルチエージェント強化学習2025/5/1
階層型マルチエージェント強化学習により、四足歩行ロボットが自律的に協調・競争サッカーを行うフレームワークを提案し、実機でロボット同士や人間との試合を実現した。
- クアッドロータ制御のためのゼロショットSim-to-Real強化学習ポリシー学習で重要な要素とは?包括的調査sim2real2024/12/1
クアッドロータの強化学習制御において、実機にゼロショットで展開するために重要な5つの要素を特定し、PPOベースのSimpleFlightを開発。従来手法より軌道追従誤差を50%以上削減した。
- NPC: 燃料効率の良い自動運転トラックのためのニューラル予測制御制御2024/12/1
車両の物理モデルを使わず、履歴データから注意機構で車両動態・道路勾配・燃料消費・制御指令の関係を学習し、燃料効率の良い制御を実現する手法を提案。
- ニューラル内部モデル制御:予測誤差フィードバックによるロバスト制御方策の学習sim2real2024/11/1
剛体力学のニューラル内部モデルと予測誤差フィードバックを強化学習に統合し、外乱に強い閉ループ制御を実現。ドローンや四足歩行ロボットで高性能を示し、実機移行も成功。
- 強化学習による静的・動的障害物回避を伴うマルチUAV編隊制御群制御2024/10/1
2段階の強化学習パイプラインと注意機構エンコーダ、カリキュラム学習を用いて、複数UAVの編隊維持と静的・動的障害物回避を両立させる手法を提案し、実機実験で有効性を示した。
- SELP: 大規模言語モデルを用いたロボットエージェントの安全で効率的なタスクプラン生成VLA2024/9/1
自然言語命令からLTL式を生成し、等価投票・制約付きデコーディング・ドメイン特化ファインチューニングを組み合わせて、安全で効率的なロボットのタスクプランを生成する手法SELPを提案した。
- FlightBench:自己視点ドローンのナビゲーションにおける学習ベース手法のベンチマークナビゲーション2024/6/1
自己視点ドローンのナビゲーションについて、学習ベース手法と最適化ベース手法を様々な難易度のシーンで比較評価する初の包括的ベンチマークを構築し、実環境での検証も行った。
- 大規模言語モデルを用いた四足歩行ロボットの長期的な移動と操作VLA2024/4/1
大規模言語モデルを活用し、四足歩行ロボットが長期的なタスクを計画・実行するシステムを構築した。強化学習による運動・操作スキルと組み合わせ、道具の作成や人間への助け要請などの複雑な行動を実現した。
- 脚式ロコモーション制御における対称性を活用した強化学習歩行2024/3/1
脚式ロボットの強化学習において、ネットワークの同変・不変性やデータ拡張で対称性を組み込み、サンプル効率と歩容品質を改善し実機へゼロショット転移できることを示した。
- Robot Synesthesia: In-Hand Manipulation with Visuotactile Sensing2023/12/1
- Learning Agile Bipedal Motions on a Quadrupedal Robot2023/11/1
- Iteratively Learn Diverse Strategies with State Distance Information2023/10/23
- OmniDrones: An Efficient and Flexible Platform for Reinforcement Learning in Drone Control2023/9/1
- LAGOON: Language-Guided Motion Control2023/6/1
- Grounding Object Relations in Language-Conditioned Robotic Manipulation with Semantic-Spatial Reasoning2023/3/1
- Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration2023/1/1
- Learning Design and Construction with Varying-Sized Materials via Prioritized Memory Resets2022/4/1
- Multi-Agent Vulnerability Discovery for Autonomous Driving with Hazard Arbitration Reward2021/12/1
- Learning to Design and Construct Bridge without Blueprint2021/8/1
- DAIR: Disentangled Attention Intrinsic Regularization for Safe and Efficient Bimanual Manipulation2021/6/1
- Evolutionary Population Curriculum for Scaling Multi-Agent Reinforcement Learning2020/3/1
- Multi-Task Reinforcement Learning with Soft Modularization2020/3/1
- Bayesian Relational Memory for Semantic Visual Navigation2019/9/1