何が起きたか
arXivは2026-09-25、視覚・言語・行動モデル向けの実世界強化学習フレームワーク「FIND」を発表した。FINDは、失敗後の環境を元に戻す手順や人手の報酬ラベルに依存せず、実行結果を次の練習対象の選択に反映する設計である。発表文では、8つの実世界操作タスクで人手評価の成功率が55%から71.9%に改善し、6時間で456回の自律エピソードを実行、scene-recovery interventionsは30回だったとしている。
詳細
FINDは、scene understanding、weakness-aware practice、self-evaluation、policy improvementを1つの持続的なworkspaceでつなぐ枠組みだとしている。視覚・言語エージェントが事前に用意したタスクライブラリから実行可能な課題を選び、直近の成功率が低いものを優先し、実行前後の観察を対にして結果を評価する方式である。 実装では、凍結したπ_{0.5} VLAとresidual off-policy RLを組み合わせた。公開されたウェブサイトは FIND.github.io とされている。
Key Facts
| arXivは2026-09-25に「Find Something You Can't Do: Agentic Real-World Reinforcement Learning for Self-Improving VLA Models」を公開した。 | [1] |
| FINDは、VLAモデルを凍結された方策のままではなく、実世界強化学習で継続改善するためのフレームワークである。 | [1] |
| 8つの実世界操作タスクで、人手評価の成功率は55%から71.9%に上がった。 | [1] |
| 代表的な実行では、6時間で456回の自律エピソードを完了し、scene-recovery interventionsは30回だった。 | [1] |
| オンライン学習中に、人手で与えた報酬ラベルは不要だったとしている。 | [1] |
本紙の見方
FINDの新しさは、VLAを一度学習して固定するのではなく、実行した結果そのものを次の練習計画に組み込む点にある。従来の実世界強化学習では、失敗後の環境復元や報酬付けの人手介入がボトルネックになりやすいが、今回の枠組みはその2点を同時に弱めようとしている。ここで重要なのは、単なる自己反省機能の追加ではなく、scene-conditionedでtask selectionを回す運用設計であり、改善の対象を「何を練習すべきか」に落とし込んでいることである。 本紙の見方では、これはモデル性能の上積みというより、学習運用の自律化に軸足を置いた発表である。8つの実世界操作タスクで55%から71.9%への改善という数字は、固定方策の限界を破る入口として読むべきだが、同時にタスク数は8にとどまる。つまり、広範な実環境全般への一般化を示したというより、限定された操作群で「失敗→観察→再練習→改善」の閉ループが機能したことを示した段階とみられる。FIND.github.ioが公開されている点も、研究としては実装再現性を意識した構成だが、公開物だけで量産的な運用性まで判断するのは早い。 今回も6時間で456回の自律エピソードと30回のscene-recovery interventionsが示された一方、成功率の改善がどの条件で維持されるか、タスクライブラリの設計が性能にどれだけ効いたか、residual off-policy RLの寄与がどの程度かは、本文中のablationだけでは読み切れない。特に、実機環境での安全性や、タスクが増えた際の再学習コストが次の確認点になるとみられる。
なぜ重要か
FINDは、VLAの学習を人手ラベル中心から、実行中の自己評価と再練習中心へ寄せる試みである。発表文によれば、8タスクで成功率が55%から71.9%に上がっており、少なくとも限定環境では自律的な改善ループが成立する可能性を示した。
日本への影響
日本のロボット研究や実機検証では、失敗後の環境復元やデータ収集の人手負担が大きいことが多い。FINDのように、実行結果から次の練習課題を選び、報酬ラベルを要しない枠組みは、実機検証の運用設計を考えるうえで参照点になりうる。