Yang Yu
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 政策不確実性を活用した効率的なワールドモデルベースVLA政策最適化のための優先ロールアウトVLA2026/9/19
VLA政策の強化学習において、政策の不確実性が高い状態に優先的にモデルロールアウトを割り当てる軽量サンプリング層U-GROWを提案し、シミュレーションと実機のマニピュレーションタスクで効率と有効性を示した。
- R2S-Eval: 視覚言語モデルによる実機からシミュレーションへのキャリブレーションを用いたロボット評価評価2026/9/3
ロボット操作ポリシーの評価を、実機からシミュレーションへのキャリブレーションと視覚言語モデルによる選好評価を組み合わせて行うパイプラインを提案し、実機評価の不安定性やコストを低減する。
- ワールドモデルポリシー学習と模倣ワールドアクションモデルの能力分離について模倣学習2026/8/23
観察デモから学習する際、将来予測を介したワールドアクションモデルと直接行動クローニングの制御能力を理論的に比較し、両者が同じ外部ポリシークラスと理想的な模倣目標を持つことを示した。
- 身体化された意思決定のための世界モデルはどう評価されるべきか:意思決定中心の立場世界モデル評価2026/6/13
世界モデルの評価方法が多様化し、主張と評価の不一致が問題となっている。本論文は、身体化された意思決定に使う世界モデルは、視覚的なリアリティよりも介入推論や計画・政策最適化の有用性で評価すべきだと論じ、L0-L7の階層的評価枠組みを提案する。
- 文脈的対比メタ強化学習による自律空中マニピュレーション強化学習/空中マニピュレーション2026/6/7
クワッドローターが多様なペイロードを自律的に把持・輸送・配送するための、文脈エンコーダと対比学習を組み合わせたメタ強化学習手法を提案。シミュレーションのみで訓練し、実機へ直接展開可能。
- 意味的スキル発見による四足ロボットの継続的協調群制御2026/6/1
複数の四足ロボットが連続的に現れる協調タスクを学習する際、過去のスキルを忘れずに再利用できる意味的スキルライブラリフレームワーク「Conquer」を提案した。
- マルチエージェント強化学習による協調的な長縄跳びマルチエージェント強化学習2026/6/1
複数の人型ロボットが協力して長縄跳びを行うためのマルチエージェント強化学習フレームワークを提案し、シミュレーションと実機でその有効性を実証した。
- 予測に基づくサブゴール生成による長期タスク解決のためのAnticipation-VLAVLA2026/5/1
長期にわたるロボットタスクを解決するため、タスクの進行に応じて適応的にサブゴールを生成する予測モデルを導入し、階層型VLAモデルを提案した。
- ReinVBC: モデルベース強化学習による車両ブレーキ制御強化学習/制御2026/4/1
オフラインのモデルベース強化学習を用いて、実車のブレーキ制御を学習し、生産グレードのABSに匹敵する性能を実現した。
- スピードアップパッチ:身体操作を加速するプラグアンドプレイ方策の学習操作/オフラインRL2026/3/1
既存の身体操作ポリシーの実行速度が遅い問題に対し、オフラインデータのみで使える軽量な外部スケジューラを導入し、行動チャンクを適応的に間引いて実行を高速化するフレームワークを提案した。
- 視覚言語行動モデルのための実用的な世界モデルベース強化学習に向けてVLA2026/3/1
VLAモデルの強化学習を実世界ではなく世界モデル内で行う枠組みVLA-MBPOを提案し、マルチビュー整合性と誤差蓄積を抑える設計で性能とサンプル効率を改善した。
- ReLAM: 視覚ロボットマニピュレーションのための予測モデルによる報酬学習マニピュレーション2025/9/1
画像から抽出したキーポイントで空間距離を推定し、行動なしの動画デモから予測モデルを用いて密な報酬を自動生成する階層強化学習フレームワークを提案。
- ImagineBench:大規模言語モデルのロールアウトを用いた強化学習の評価ベンチマーク強化学習ベンチマーク2025/5/15
LLMが生成した仮想経験(imaginary rollouts)と実環境のロールアウトを併用するオフライン強化学習アルゴリズムを評価する初のベンチマークを提案し、既存手法の課題と今後の研究方向を示した。
- Dual-AEB: ルールベースとマルチモーダル大規模言語モデルを融合した緊急ブレーキシステム自動運転2024/10/1
マルチモーダル大規模言語モデルによるシーン理解と従来のルールベースAEBを組み合わせ、開放的な状況でも迅速に緊急ブレーキを判断できるシステムを提案した。
- リカレント強化学習の安定化のための文脈エンコーダ専用学習率強化学習2024/5/24
部分観測マルコフ決定過程(POMDP)向けのリカレント強化学習において、文脈エンコーダに他層より低い学習率を設定することで訓練の安定性を高める手法RESeLを提案し、18のPOMDPタスクと5つのMDPタスクで有効性を示した。
- PALoc: Advancing SLAM Benchmarking with Prior-Assisted 6-DoF Trajectory Generation and Uncertainty Estimation2024/1/1
- Policy Regularization with Dataset Constraint for Offline Reinforcement Learning2023/6/11
- Learning Physically Realizable Skills for Online Packing of General 3D Shapes2022/12/1
- Monocular Camera Mapping with Pose-Guided Optimization: Enhancing Marking-Level HD Map Accuracy2022/9/1
- The Role of the Hercules Autonomous Vehicle During the COVID-19 Pandemic: An Autonomous Logistic Vehicle for Contactless Goods Transportation2020/4/1
- Key Ingredients of Self-Driving Cars2019/6/1
- Automatic Calibration of Multiple 3D LiDARs in Urban Environments2019/5/1