Zilei Yang
収録論文 2本 ・ フィジカルAI/ロボット学習
報酬モデル安全強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TrustRoboReward: 選好順序付き等調スコア編集によるマルチパラダイムロボット報酬モデル報酬モデル2026/8/9
ロボット操作の強化学習における報酬モデルのボトルネックを解決するため、ペアワイズ選好とビデオQAを統合したマルチパラダイム報酬モデリングフレームワークを提案し、スコアと選好の矛盾を等調回帰で解消する。
- ParallelCBF: テンソル並列強化学習のための合成可能な安全フィルタと監査可能性フレームワーク安全強化学習2026/5/1
UAVシミュレーション、CBF安全フィルタ、BC-to-RLパイプライン、運用監査を統合した初のフレームワークを提案し、事前登録や監査APIにより再現性を高める。