何が起きたか
RynnValueは2026-08-10に、ロボット操作向けのオープンソース価値基盤モデル「RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance」を公表した。学習の監督信号を、好みや正規化された進捗ではなく、観測から言語で指定された目標までの時間的距離に置き換えた点が特徴である。論文によると、7,000時間超と約300万件の指示条件付きクリップを使い、好みラベルなしで学習した。
詳細
モデルは、時刻情報から直接作れる temporal-distance ラベルを用いるため、好み注釈や進捗注釈を必要としないとしている。学習安定化のために、random temporal sampling、temporal-order shuffling、value-isolation attention を組み合わせ、失敗や後退に鈍感になる近道を抑える設計を採った。 評価では、RBM-EVAL-OODで平均 Kendall's τ_a が0.704となり、完全な好み教師ありの最先端手法の0.655を上回った。さらに、ゼロショットで未見のタスク・身体構成・視点に一般化するとしている。下流応用としては、potential-based shaping による dense reward 化で実世界ポリシー成功率がオンライン52.5%から72.5%、オフライン63.8%から82.5%に上がり、data filtering では multi-task behavior cloning の成功率が35.0%から42.5%に、inference-time value guidance では frozen policy の成功率が67.5%から80.0%に改善したとしている。
Key Facts
| RynnValueはロボット操作向けのオープンソース価値基盤モデルである。 | [1] |
| 監督信号に temporal distance を用い、好み注釈や進捗注釈に依存しない設計である。 | [1] |
| 学習規模は7,000時間超、約300万件の指示条件付きクリップである。 | [1] |
| RBM-EVAL-OODで平均 Kendall's τ_a は0.704で、完全な好み教師ありの0.655を上回った。 | [1] |
| dense reward 化で実世界ポリシー成功率はオンライン52.5%→72.5%、オフライン63.8%→82.5%だった。 | [1] |
本紙の見方
この発表の新しさは、ロボットの価値モデルを「好みラベルで学ぶ」流儀から、時刻差分というより機械的に生成しやすい監督へ寄せた点にある。既定路線の延長としては、価値推定を報酬モデルやポリシー改善の中核に置く構図自体は従来通りだが、RynnValueはその入力を人手依存の注釈から時系列情報へ置き換えたところに違いがある。7,000時間超と約300万件という規模は、価値学習を小規模なベンチマークから大規模な異種コーパス処理へ押し広げる試みと読める。 本紙の過去報道は与えられていないため、連続性の確認はできない。ただし本件は、ロボット学習でデータ収集よりも「どの信号を正解とみなすか」がボトルネックになっていることを示す。好み注釈や進捗注釈は、実機・シミュレーション・異なる身体構成をまたぐと整合しにくい。これに対し temporal distance は時刻から直接作れるため、ラベル生成の再現性を高めやすい一方、目標到達までの距離が本当に価値と一致するかは検証が必要である。 業界構造への含意としては、ロボットの学習基盤が「高品質な行動データ」だけでなく「学習対象の定義」を巡る競争に移る可能性がある。random temporal sampling、temporal-order shuffling、value-isolation attention まで含めて設計している点は、単なるデータ追加ではなく、時系列データから失敗・後退を学習させる処理系そのものを整備しようとしていることを示す。ゼロショットで未見のタスク、身体構成、視点に一般化したという記述は、ロボットごとの個別最適よりも共通価値表現の有効性を試しているとみられる。 未確定の論点は、7,000時間超と約300万件の内訳、どの実機・シミュレーション・公開データを含むのか、またオンライン/オフラインの各成功率がどのベースライン条件で測られたのかである。さらに、temporal distance がどのタスクで失敗や後退をどこまで判別できるか、量産的なロボット導入に耐える安全性や頑健性は今後の確認が必要である。
なぜ重要か
RynnValueは、好みラベルを集めにくいロボット操作領域で、時間情報から監督信号を作る方法を示した。論文では7,000時間超・約300万件の規模で学習し、RBM-EVAL-OODや実機成功率で既存手法を上回ったとしており、データ収集と評価の両方に関わる。