Yaodong Yang
The Chinese University of Hong Kong
収録論文 43本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- コードがシミュレーションを担い、Jevが評価を担うVLA2026/10/1
判断モデルJevは入力記述から評価できるタスクは得意だが、相手の行動や順序予測などシミュレーションが必要なタスクは苦手であり、シミュレーションをコードに任せるべきだと示した。
- 強化学習ファインチューニングによる協調マルチエージェント視覚言語行動モデルVLA2026/9/29
事前学習済みVLAを3段階の強化学習ファインチューニングでマルチロボット協調に適応させ、初期化対応データ収集・オフライン信用フィルタリング・潜在空間オンラインRLにより成功率を大幅に向上させた。
- RoboFFT:順過程を用いたオンライン強化学習による生成ロボット方策のファインチューニングVLA2026/9/26
生成モデルベースの方策を、順過程ノイズ付加とスコアマッチング損失でPPO的にファインチューニングする手法を提案し、模倣学習の限界を強化学習で改善する。
- EgoSteer: 自己中心視点ビデオからの操縦可能な器用操作を実現するフルスタックシステム器用操作/VLA2026/7/1
自己中心視点の人間ビデオから大規模な事前学習データを構築し、言語指示に従う器用なロボット操作ポリシーを学習するフルスタックシステムを提案。実ロボットへの適応も効率的で、多様なタスクで高い成功率を達成した。
- LAMP: 潜在運動事前分布による実世界での器用な手操作学習のガイドマニピュレーション2026/7/1
高次元の手の動作を扱う実世界学習の不安定さを解決するため、潜在運動事前分布モジュールを導入し、模倣学習とオンライン強化学習を組み合わせた3段階の学習フレームワークを提案。実ロボット4タスクで高い成功率を達成。
- 実世界ロボット強化学習にはデモ1回で十分強化学習2026/7/1
単一のデモンストレーションを用いて、実世界のロボット強化学習における介入プロセスを自動化するフレームワークAutoSERLを提案し、複数の接触を伴う操作タスクで高い成功率と堅牢性を達成した。
- 周波数認識フローマッチングによる連続かつ一貫したロボット動作生成動作生成2026/6/1
離散的な動作チャンクに依存せず、周波数領域でフローマッチングを行うことで、異なる制御周波数や時間的不整合に頑健な連続動作を生成する手法を提案した。
- RedVLA: 視覚言語行動モデルに対する物理的レッドチーミング安全性2026/4/1
VLAモデルの物理的安全性リスクを事前検出するため、リスクシナリオ合成とリスク増幅の2段階からなるレッドチーミングフレームワークRedVLAを提案し、生成データで軽量ガードSimpleVLA-Guardも構築した。
- MVR: 強化学習のためのマルチビュー動画報酬整形報酬設計2026/3/2
複数視点の動画と視覚言語モデルを用いて状態の関連性を学習し、タスク報酬とVLMガイダンスを統合する報酬整形フレームワークを提案。静的画像に基づく手法のバイアスを軽減し、複雑な動作を伴うタスクでの性能を向上させる。
- DexKnot: 器用な袋結び操作のための汎化可能な視覚運動ポリシー学習マニピュレーション2026/3/1
袋結びの汎化可能なポリシーを、キーポイントのアフォーダンスと拡散ポリシーを組み合わせて学習するフレームワークを提案した。
- CDF-Glove: ケーブル駆動の力覚フィードバック手袋による巧みな遠隔操作遠隔操作/力覚フィードバック/模倣学習2026/3/1
軽量・低コストなケーブル駆動の力覚フィードバック手袋を開発し、遠隔操作による模倣学習のデモ品質を向上させた。
- CABTO: ロボットマニピュレーションのための文脈認識型ビヘイビアツリー接地マニピュレーション2026/3/1
ビヘイビアツリーの行動モデルと制御ポリシーを大規模モデルで自動構築する枠組みCABTOを提案し、3つのマニピュレーション場面で有効性を示した。
- 長時間ロボット卓上ゲームにおける内部状態整合性を維持するシステム設計システム設計2026/3/1
ロボットによる長時間の卓上ゲーム(麻雀)で、知覚や実行の小さな誤りが状態を破壊する問題に対し、状態を明示的に分離・監視し、触覚トリガーによる回復機構を備えた統合アーキテクチャを提案・実証した。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- ECO: ヒューマノイド歩行のためのエネルギー制約付き強化学習最適化歩行2026/2/1
エネルギー消費を報酬から切り離し明示的な不等式制約として扱う制約付き強化学習フレームワークECOを提案し、ヒューマノイドBRUCEで省エネかつ安定した歩行を実現した。
- マルチモーダルエージェントによるロボット強化学習の加速強化学習2026/2/1
人間の代わりにマルチモーダルエージェントが修正ウェイポイントや空間制約を与え、ロボットの強化学習を効率化するAGPSを提案。
- プリズマティック・ワールドモデル:ハイブリッド系の計画のための合成可能なダイナミクス学習モデルベース計画2025/12/1
接触や衝突などの離散的な物理モードを専門家混合(MoE)で分解し、モード遷移を考慮した潜在ワールドモデルを提案。ヒューマノイドなどの連続制御タスクで軌道最適化の精度を向上させた。
- RoboSafe: 実行可能な安全ロジックによる身体性エージェントの保護安全/身体性エージェント2025/12/1
VLMベースの身体性エージェントに対し、短期・長期の安全メモリを用いた後方反省推論と前方予測推論を組み合わせ、実行可能な述語ロジックで危険行動を未然に防ぐランタイム安全ガードレールを提案。
- VLA-Arena: 視覚言語行動モデルを評価するためのオープンソースベンチマークフレームワークVLA2025/12/1
VLAモデルの能力限界と失敗モードを定量化するため、タスク構造・言語・視覚の3軸で難易度を設計した170タスクのベンチマークを提案し、最先端モデルの汎化不足や安全性軽視を明らかにした。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- RobustVLA: マルチモーダル摂動に対する視覚-言語-行動モデルのロバスト性VLA2025/10/1
VLAモデルの17種類の摂動に対するロバスト性を評価し、行動が最も脆弱であることを発見。出力と入力の両方に対するロバスト化手法を提案し、LIBEROで大幅な性能向上を達成。
- DexFlyWheel:器用なマニピュレーションのためのスケーラブルで自己改善するデータ生成フレームワークマニピュレーション2025/9/1
模倣学習と残差強化学習を組み合わせた自己改善サイクルにより、多様な器用マニピュレーションのデータを自動生成し、ポリシー性能を向上させるフレームワークを提案。
- 視覚-言語-行動モデルサーベイ:行動トークン化の観点からVLA2025/7/1
視覚と言語の入力を行動トークンに変換して実行するVLAモデルを、行動トークンの種類(言語記述・コード・アフォーダンス・軌道など)で分類し、各手法の長所と課題を整理したサーベイ。
- ClutterDexGrasp:散らかった環境での汎用器用把持のためのSim-to-Realシステムマニピュレーション2025/6/1
散らかったシーンで目標物体を把持するため、シミュレーションで教師方策を訓練し、3D拡散方策の生徒モデルに蒸留して実機にゼロショット転移する閉ループシステムを提案した。
- 予測力注意を伴う適応的視触覚融合による巧みなマニピュレーションマニピュレーション2025/5/1
力誘導注意融合モジュールと自己教師あり未来力予測を導入し、操作段階に応じて視覚と触覚の重みを適応的に調整することで、接触の多い3つの実世界タスクで平均93%の成功率を達成した。
- 身体性エージェントと人間の適応のための通信効率の良い欲求アラインメントVLA2025/5/1
家庭支援シミュレーション環境HA-Desireを構築し、曖昧な指示からユーザの潜在的な欲求を推論して適応するフレームワークFAMERを提案した。欲求ベースの心的推論と反省ベースの通信モジュールにより、タスク実行と通信効率を大幅に向上させた。
- SafeVLA:制約付き学習による視覚言語行動モデルの安全アラインメントVLA2025/3/1
視覚言語行動モデル(VLA)に制約付きマルコフ決定過程を用いた安全強化学習を適用し、タスク成功率を維持しつつ安全違反コストを大幅に削減する手法を提案した。
- Falcon: 部分ノイズ除去による高速視覚運動ポリシーVLA2025/3/1
拡散ポリシーの推論を高速化するため、過去の行動の部分ノイズ除去結果を再利用する学習不要の手法を提案し、性能を維持しつつ2〜7倍の速度向上を実現した。
- 把持不能物体に対する外的手先による巧みな非把持マニピュレーションマニピュレーション2025/3/1
強化学習を用いて、把持できない大きな物体を机の端や壁へ移動させてから掴む戦略を学習するロボットハンドシステムExDexを提案し、実機へのゼロショット転移も実証した。
- 微分可能情報を活用したモデルベース強化学習の強化モデルベース強化学習2025/3/1
微分可能環境の情報を活用し、Sobolev損失でモデル予測精度を高め、混合長さの切り詰め学習で方策勾配の分散を抑えるMBRL手法MB-MIXを提案。ヒューマノイド制御や変形物体操作で既存手法を上回る。
- DexGraspVLA:汎用器用把持に向けた視覚-言語-行動フレームワークVLA2025/2/1
事前学習済み視覚言語モデルを高レベル計画に、拡散ベースの行動制御器を低レベルに用いた階層型フレームワークで、多様な未見の乱雑シーンでも90%以上の器用把持を実現した。
- RetrDex: 多指ハンドによる散らかった環境での効率的な物体取り出しマニピュレーション2025/2/1
散らかった環境で目標物体を取り出すため、大規模並列強化学習と遮蔽状況を考慮した空間表現を用い、押す・かき混ぜる・突くなどの多様な操作を学習する枠組みを提案し、実機へのゼロショット転移も示した。
- RAT: 深層強化学習エージェントの標的行動を誘導する敵対的攻撃強化学習2024/12/1
人間の選好に沿った意図方策を標的として学習させ、リプレイバッファ内の状態占有度を動的に調整することで、強化学習エージェントを特定の行動へ誘導する敵対的攻撃手法RATを提案した。
- 人間の手の動きデータを用いた物体中心の巧みな操作マニピュレーション2024/11/1
人間の手の動作データから物体操作のための階層的な方策を学習し、シミュレーションと実機の双腕多指ハンドで汎化性能を示した。
- ニューラルアテンションフィールド:3Dシーンにおける点間関連性の創発とワンショット巧み把持マニピュレーション2024/10/1
3D空間の任意のクエリ点とシーン点群のクロスアテンションを計算するトランスフォーマーデコーダを自己教師あり学習し、ワンショット実演から新しいシーンで巧みな把持を実現する手法を提案。
- 拡散ポリシーによる巧みな機能的把持前操作マニピュレーション2024/3/1
物体を掴む前に位置や向きを器用に調整する把持前操作を、教師-生徒学習と拡散ポリシーで実現し、30種類以上の物体で72.6%の成功率を達成した研究。
- AnySkill: 対話型エージェントのためのオープン語彙物理スキル学習VLA2024/3/1
模倣学習で獲得した原子動作を、CLIP類似度を報酬とする高レベル方策で組み合わせ、未知のテキスト指示に応じた物理的に自然な人間動作を生成する階層的手法を提案。
- Grasp Multiple Objects with One Hand2023/10/1
- Dynamic Handover: Throw and Catch with Bimanual Hands2023/9/1
- UniDexGrasp++: Improving Dexterous Grasping Policy Learning via Geometry-aware Curriculum and Iterative Generalist-Specialist Learning2023/4/1
- GenDexGrasp: Generalizable Dexterous Grasping2022/10/1
- End-to-End Affordance Learning for Robotic Manipulation2022/9/1
- Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning2022/6/1