Souradip Chakraborty
収録論文 8本 ・ フィジカルAI/ロボット学習
VLARLHF
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VARP: 視覚言語モデルのフィードバックとエージェント正則化選好による強化学習VLA2025/3/1
軌跡スケッチを重ねた画像でVLMの選好ラベル精度を高め、エージェントの性能で報酬学習を正則化することで、連続制御タスクの成功率とリターンを大幅に改善した手法。
- テキストを超えて:音声的手がかりを活用したロボットナビゲーションタスクにおけるLLMの意思決定改善VLA2024/2/1
音声の韻律的特徴をLLMに統合し、ロボットの社会的ナビゲーションにおける意思決定精度と敵対的攻撃への堅牢性を向上させる手法を提案した。
- MaxMin-RLHF:多様な人間選好へのアラインメントRLHF2024/2/1
単一報酬モデルのRLHFでは人間選好の多様性を表現できないことを示し、選好分布の混合をEMで学習して平等主義的なMaxMin目的で方策を最適化する手法を提案した論文。
- LLM/VLM制御ロボティクスの脆弱性VLA2024/2/1
LLMやVLMで制御されるロボットが入力のわずかな変化に弱く、タスク成功率が最大22.2%低下することを実験で示した研究。
- REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback2023/12/1
- RE-MOVE: An Adaptive Policy Design for Robotic Navigation Tasks in Dynamic Environments via Language-Based Feedback2023/3/1
- HTRON:Efficient Outdoor Navigation with Sparse Rewards via Heavy Tailed Adaptive Reinforce Algorithm2022/7/1
- Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies2022/6/1