何が起きたか
0.8Bのハイブリッド言語モデルを操作向けに調整した研究で、学習可能パラメータは6.2M、評価はLIBERO-Spatialの3課題に対する6条件・3シード・540回の保留ロールアウトで行われた。arXivに2026-09-06付で掲載された論文は、幾何増分を用いた訓練条件の違いが成功率にどう影響するかを比較したものである。 幾何増分で再帰減衰ゲートを条件付けした設定は28.9%の成功率だった一方、同じ増分を訓練時にシャッフルした設定は36.7%、明示的な物体・目標幾何を使わない設定は24.4%だった。別の検証では、状態のみの相対座標ポリシーがフレーム再ラベルで10回中7回を維持したのに対し、試した4つの視覚ポリシーはいずれも5cmの物体移動後に20回中3回以下まで落ちた。
詳細
論文は、幾何増分を入力として扱う複数の条件を比較した。トークン・アダプタを同じ増分で動かした設定は27.8%で、シード間の差があり結論はなお不確定とされている。トークン時計条件付けは11.1%で、1つのシードでは収束しなかった。 著者らは、評価時点では両方の幾何ポリシーに正しい入力が与えられていたとしている。それでも、訓練時の幾何整合から信頼できる優位性は得られず、座標の不変性と物理的な配置一般化の間に差があることが示されたとしている。論文にはエピソード記録、シード別分析、図生成コードが付属する。
Key Facts
| arXiv掲載日は2026-09-06である。 | [1] |
| 研究対象は0.8Bのハイブリッド言語モデルで、操作向けに調整されている。 | [1] |
| 学習可能パラメータは6.2Mである。 | [1] |
| 評価はLIBERO-Spatialの3課題、6条件、3シード、540回の保留ロールアウトで行われた。 | [1] |
| 幾何増分で再帰減衰ゲートを条件付けした設定の成功率は28.9%で、訓練時に増分をシャッフルした設定は36.7%だった。 | [1] |
本紙の見方
この論文の新しさは、物理状態入力や幾何条件付けを入れれば操り性能が機械的に上がる、という単純な見方を崩している点にある。0.8Bのハイブリッドモデルに6.2Mの学習可能パラメータを追加し、LIBERO-Spatialの3課題で6条件を比較した結果、幾何増分を使う設計が28.9%にとどまり、むしろ増分を訓練時にシャッフルした条件の36.7%を下回った。明示的な物体・目標幾何を外した条件も24.4%であり、少なくともこの訓練レシピでは幾何情報の入れ方そのものが性能向上の保証にならない。 本紙の観点では、これは「座標を入れるかどうか」の議論から、「どの表現が物理配置の再現に効くか」という工程問題に移っている。幾何増分を再帰減衰ゲートに入れる方式、同じ増分を使うトークン・アダプタ方式、トークン時計条件付けという3系統が並んだが、27.8%、28.9%、11.1%と結果はそろわなかった。特にトークン時計条件付けで1シードが収束しなかった事実は、設計差の優劣以前に学習の安定性が詰め切れていないことを示す。 既定路線との違いは、モデル規模の拡大や入力モダリティの追加よりも、診断の置き方にある。著者らは、評価時には幾何ポリシーに正しい入力が与えられていたと明記し、それでも訓練時の幾何整合に一貫した利得は見えないと結論づけた。さらに、状態のみの相対座標ポリシーはフレーム再ラベルに7/10で耐えた一方、視覚ポリシーは5cmの物体移動で最大3/20まで落ちた。ここから、座標系の不変性と実物体配置への一般化は別問題であり、評価指標も別々に設計しなければならないことが読み取れる。 本紙の関連記事はないため、過去報道との連続性は置けない。次に確認すべき論点は、6.2Mという調整規模が他の操作ベースモデルでも再現するか、3課題以外で同じ傾向が出るか、そしてどの入力方式が学習安定性と配置一般化の両方を満たすかである。論文はエピソード記録とシード別分析を付けているため、平均成功率だけでなく分散の扱いが焦点になる。
なぜ重要か
この結果は、物理ロボット向けのモデル設計で、幾何情報を入れればよいという前提をそのまま置けないことを示している。論文の条件では、同じ増分を使っても方式によって28.9%、27.8%、11.1%と差があり、評価時に正しい入力を与えても改善が揃わなかったためである。 また、状態のみの相対座標ポリシーと視覚ポリシーで、フレーム再ラベル耐性と5cm移動後の性能低下が分かれたことから、座標不変性と物理配置一般化を別に検証する必要がある。モデルをどの表現で学習させるかだけでなく、何をもって成功とみなすかが実装上の課題になる。