何が起きたか

ICRA 2026の競技会LeHome Challenge 2026で、両腕による衣類折りたたみシステムがオンライン(シミュレーション)ラウンドで62チーム中1位、実機決勝で2位を獲得した。著者はarXivで技術詳細を公開した。

詳細

システムは視覚・言語・行動(VLA)ポリシーを強化学習ループで改善する。同一ネットワークが行動予測に加えて成功確率・進捗・タスク関連の将来量を予測し、それらをアドバンテージ推定・リアルタイム失敗検出・候補選択に利用する。著者は既存のRL手法(AWR、RECAP)をフローマッチングVLAに組み合わせ、非同期分散トレーニング/ロールアウトパイプラインをHuggingFace Hub経由で構築した。推論時のハイパーパラメータ最適化にはThompsonサンプリングを用い、sim-to-realではカメラアライメントツール、データ拡張、DAgger風の人間参加型データ収集を採用した。

Key Facts

LeHome Challenge 2026はICRA 2026の競技会で、両腕による衣類折りたたみを対象とする。出典一覧
システムはオンライン(シミュレーション)ラウンドで62チーム中1位、実機決勝で2位を獲得した。出典一覧
システムは視覚・言語・行動(VLA)ポリシーを強化学習ループで改善する。出典一覧
同一ネットワークが行動予測に加えて成功確率・進捗・タスク関連の将来量を予測し、アドバンテージ推定・失敗検出・候補選択に利用する。出典一覧
著者は既存のRL手法(AWR、RECAP)をフローマッチングVLAに組み合わせ、非同期分散トレーニング/ロールアウトパイプラインをHuggingFace Hub経由で構築した。出典一覧

本紙の見方

今回の成果は、衣類折りたたみという細かい操作を要するタスクで、VLAポリシーを自己価値関数として機能させる点が新しい。従来のVLAは行動生成に特化し、価値推定は別ネットワークに任せるのが一般的だが、本手法は同一ネットワークに価値予測を担わせることで、学習と推論の効率を高めている。また、既存のRL手法(AWR、RECAP)をフローマッチングVLAに組み合わせた点は、手法の再結合による実用的なレシピを提示しており、個別の貢献としても利用可能としている。 本紙の過去報道との接続はないが、ロボット学習分野ではシミュレーションから実機への転移(sim-to-real)が常に課題であり、本手法はカメラアライメントツールやDAgger風のデータ収集でこの課題に対処している。業界構造への含意としては、衣類折りたたみのような変形物操作は物流や家事支援ロボットの応用が期待される領域であり、競争が激化している。本手法が公開されることで、他チームが同様のアプローチを採用する可能性がある。 未確定の論点としては、実機決勝で2位に留まった要因(シミュレーションと実機の差、汎化性能など)や、提案手法の各要素がどの程度性能に寄与したかのアブレーションが挙げられる。また、実機での成功率や処理速度などの定量的な評価が公開されていないため、今後の詳細な報告が待たれる。

なぜ重要か

本成果は、VLAポリシーを自己価値関数として用いることで、衣類折りたたみのような複雑な操作タスクにおいて強化学習の適用可能性を示した。これは、ロボットが家庭や物流現場で衣類を扱う際の基盤技術となり得る。また、既存手法の再結合と工学的工夫を公開したことで、コミュニティ全体の進展に寄与する可能性がある。