Shanshan Wang
収録論文 1本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CriticHack: ロボット方策最適化下での視覚報酬の評価VLA2026/10/1
学習した視覚報酬モデルで方策を最適化すると、報酬とタスク成功率が上がっても誤対象への失敗が増幅されることを示し、その原因をKL正則化下の傾きモデルで説明した論文。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
学習した視覚報酬モデルで方策を最適化すると、報酬とタスク成功率が上がっても誤対象への失敗が増幅されることを示し、その原因をKL正則化下の傾きモデルで説明した論文。