何が起きたか

LeHome Challenge 2026のガーメント両手折り畳み課題で、提出者は62チーム中1位のオンライン(シミュレーション)予選と、実機の決勝で2位を得た解法を公表した。発表日は2026-06-25で、対象はICRA 2026の競技である。解法は視覚・言語・行動のVLA方策を強化学習ループで改善するもので、同じネットワークが行動だけでなく成功、進捗、将来量も予測する。

詳細

手法は、AWRとRECAPを組み合わせたflow-matching VLA、HuggingFace Hubを通じた非同期分散学習・ロールアウト、推論時ハイパーパラメータ最適化のためのThompson sampling、そしてカメラ位置合わせツール、強い拡張、DAggerに似たHILデータ収集を含むsim-to-real手順で構成される。説明では、同一ネットワークの予測が advantage estimation、ライブの失敗検知、候補選択に使われるとしている。

Key Facts

LeHome Challenge 2026の結果として、62チーム中1位のオンライン(simulation)ラウンドと2位の実機決勝を得た。[1]
課題はICRA 2026の競技である両手ガーメント折り畳みである。[1]
解法はVLA policyを強化学習ループで改良する構成である。[1]
同一ネットワークが行動、成功、進捗、将来量を予測し、その予測がadvantage estimation、ライブ失敗検知、候補選択に使われる。[1]
AWRとRECAPの組み合わせ、HuggingFace Hub経由の非同期分散学習・ロールアウト、Thompson samplingによる推論時最適化、sim-to-real手順が使われた。[1]

本紙の見方

この発表の新しさは、単一の新規アルゴリズムというより、既存の強化学習要素を実機衣服折り畳み向けに一つの運用手順へ束ねた点にある。VLA方策に対して、行動予測だけでなく成功・進捗・将来量まで同一ネットワークで持たせ、その出力を学習と実行の両方に使う設計は、認識から制御までを一体で最適化する発想だといえる。一方で、発表文は「existing RL ideas」を再構成したものだと明言しており、手法の基礎部分は既定路線の延長にある。競技結果としては、オンライン1位と実機2位が分かれているため、シミュレーション上の優位がそのまま現場に移るとは限らないことも読み取れる。 本紙の関連記事はないが、この事例はロボット学習の論点が「単発のモデル性能」から「分散学習、データ収集、推論時の調整、sim-to-real」の接続へ移っていることを示す。HuggingFace Hubを使った非同期分散学習・ロールアウトは、学習基盤そのものが実験装置の一部になっていることを意味する。さらに、カメラ位置合わせツールや強い拡張、DAgger-like HILデータ収集が入っているため、衣服という変形物を扱うには、モデル単体よりもデータの取り方と実機補正の設計が成否を左右するとみられる。Thompson samplingによる推論時のハイパーパラメータ最適化は、現場での微調整をアルゴリズムの外側ではなく運用に組み込む試みだ。 業界構造への含意としては、両手マニピュレーションのような非定型作業では、教師データ、分散学習基盤、実機フィードバックの3点が連結したレシピ化が競争力になる可能性がある。逆に言えば、モデルの公開だけでは実機2位という結果は再現しにくく、カメラ校正やHIL収集のような周辺工程が実装の差を生む。未確定の論点は、実機決勝での失点要因、各RL要素の寄与、推論時最適化の安定性、そしてこのレシピが衣服以外の両手作業にどこまで転用できるかである。

なぜ重要か

発表者は、同じネットワークを行動予測と成功・進捗予測の両方に使い、さらにその出力で失敗検知や候補選択まで行うとしている。これにより、学習済みモデルを実機の判断に直結させる構成が、両手で扱う変形物の作業では有効になりうることが示された。

日本への影響

衣服の両手折り畳みは、カメラ位置合わせ、強い拡張、HILデータ収集まで含めた実機学習の作り込みが重要であることを示す。日本のロボット研究や製造現場でこの種の作業を扱う場合、モデル単体よりも、実機データ取得と推論時調整を支える基盤整備が論点になるとみられる。