何が起きたか
ICRA 2026の競技会LeHome Challenge 2026で、両腕による衣類折りたたみシステムがオンライン(シミュレーション)ラウンドで62チーム中1位、実機決勝で2位を獲得した。著者はarXivで技術詳細を公開した。
詳細
システムは視覚・言語・行動(VLA)ポリシーを強化学習ループで改善する。同一ネットワークが行動予測に加えて成功確率・進捗・タスク関連の将来量を予測し、それらをアドバンテージ推定・リアルタイム失敗検出・候補選択に利用する。著者は既存のRL手法(AWR、RECAP)をフローマッチングVLAに組み合わせ、非同期分散トレーニング/ロールアウトパイプラインをHuggingFace Hub経由で構築した。推論時のハイパーパラメータ最適化にはThompsonサンプリングを用い、sim-to-realではカメラアライメントツール、データ拡張、DAgger風の人間参加型データ収集を採用した。
Key Facts
| LeHome Challenge 2026はICRA 2026の競技会で、両腕による衣類折りたたみを対象とする。 | [1] |
| システムはオンライン(シミュレーション)ラウンドで62チーム中1位、実機決勝で2位を獲得した。 | [1] |
| システムは視覚・言語・行動(VLA)ポリシーを強化学習ループで改善する。 | [1] |
| 同一ネットワークが行動予測に加えて成功確率・進捗・タスク関連の将来量を予測し、アドバンテージ推定・失敗検出・候補選択に利用する。 | [1] |
| 著者は既存のRL手法(AWR、RECAP)をフローマッチングVLAに組み合わせ、非同期分散トレーニング/ロールアウトパイプラインをHuggingFace Hub経由で構築した。 | [1] |
なぜ重要か
本成果は、VLAポリシーを自己価値関数として用いることで、衣類折りたたみのような複雑な操作タスクにおいて強化学習の適用可能性を示した。これは、ロボットが家庭や物流現場で衣類を扱う際の基盤技術となり得る。また、既存手法の再結合と工学的工夫を公開したことで、コミュニティ全体の進展に寄与する可能性がある。