Hiroaki Kingetsu
収録論文 1本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SynthDemo-RL:LLM誘導合成デモでVLA適応のゼロ報酬障壁を突破VLA2026/9/18
LLM教師が合成デモを生成し、VLA学生をSFTで蒸留後PPOで微調整することで、人間のデモなしにスパース報酬タスクの成功率を大幅に改善する手法を提案。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
LLM教師が合成デモを生成し、VLA学生をSFTで蒸留後PPOで微調整することで、人間のデモなしにスパース報酬タスクの成功率を大幅に改善する手法を提案。