Kai Zhao
収録論文 6本 ・ フィジカルAI/ロボット学習
世界モデルマルチエージェント強化学習RLHF
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Sub-JEPA: 部分空間ガウス正則化による安定なエンドツーエンド世界モデル世界モデル2026/5/10
JEPA世界モデルの学習崩壊を防ぐため、埋め込み空間全体ではなく複数のランダム部分空間にガウス事前分布を課す手法を提案し、連続制御タスクで既存手法を大きく上回る性能を示した。
- OPTIMA: 協調を考慮した自動運転車を実現するインテリジェントマルチエージェントシステム向け最適化ポリシーマルチエージェント強化学習2024/10/1
接続自動運転車の協調タスク向けに、環境との相互作用からのデータサンプリングとマルチエージェント強化学習を交互に行う分散学習フレームワークOPTIMAを提案し、安全性と効率性を両立させる。
- Uni-RLHF:多様な人間フィードバックを用いた強化学習のための汎用プラットフォームとベンチマークスイートRLHF2024/2/1
多様な人間フィードバックを扱うRLHFのための注釈プラットフォーム、大規模クラウドソーシングデータセット、モジュール式オフラインRLHFベースラインを提供する統合システムを構築し、30以上のタスクで1500万ステップを超えるデータを収集して評価した。
- ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles2023/6/1
- A Closed-Loop Perception, Decision-Making and Reasoning Mechanism for Human-Like Navigation2022/7/1
- Learning to Navigate in a VUCA Environment: Hierarchical Multi-expert Approach2021/11/1