何が起きたか
研究チームは、器用な操作のための汎用ロボットポリシーRLDX-1を発表した。RLDX-1は、異種モダリティを統合するMulti-Stream Action Transformer (MSAT)アーキテクチャを採用し、シミュレーションと実世界のタスクで評価された。ALLEXヒューマノイドタスクでは成功率86.8%を記録し、比較対象のπ0.5とGR00T N1.6が約40%だったのに対し、優位性を示した。
詳細
RLDX-1は、視覚言語行動モデル(VLA)の課題を解決するために開発された。VLAは事前学習済みの視覚言語モデルから汎用性を継承するが、動作認識、長期記憶、物理センシングなどの機能が不足している。RLDX-1は、モダリティ固有のストリームとクロスモーダルな自己注意を備えたMSATにより、これらの機能を統合する。さらに、稀な操作シナリオのためのデータ合成、人間らしい操作のための学習手順、リアルタイム展開のための推論最適化などのシステム設計を組み合わせている。
Key Facts
| RLDX-1はMulti-Stream Action Transformer (MSAT)アーキテクチャを採用し、異種モダリティを統合する。 | 出典一覧 |
| RLDX-1はALLEXヒューマノイドタスクで成功率86.8%を達成した。 | 出典一覧 |
| 比較対象のπ0.5とGR00T N1.6は約40%の成功率だった。 | 出典一覧 |
| RLDX-1はシミュレーションと実世界のタスクで、最近のフロンティアVLAを一貫して上回った。 | 出典一覧 |
| RLDX-1はデータ合成、学習手順、推論最適化などのシステム設計を組み合わせている。 | 出典一覧 |
本紙の見方
RLDX-1の発表は、ロボットポリシー研究における新たな一歩と位置づけられる。既存のVLAモデルが汎用性に焦点を当てる一方で、RLDX-1は動作認識や物理センシングなどの機能を統合し、高自由度のヒューマノイド操作を可能にした。特に、ALLEXタスクでの成功率の差は顕著であり、接触を伴う動的な操作における優位性を示している。 本紙の過去報道との接続はないが、この成果はロボット学習におけるアーキテクチャ設計の重要性を再確認させる。MSATのクロスモーダルな自己注意は、異なるモダリティ間の相互作用を強化し、複雑なタスクの実行を可能にしたとみられる。 業界構造への含意として、この技術はヒューマノイドロボットの実用化を加速させる可能性がある。高自由度の制御が可能になれば、製造業や介護などの分野での応用が期待される。一方で、実世界での信頼性や安全性の検証が今後の焦点になる。 未確定の論点としては、RLDX-1の実世界での汎用性や、他のタスクでの性能が挙げられる。また、データ合成の手法や学習手順の詳細が公開されていないため、再現性の確認も必要である。
なぜ重要か
RLDX-1は、VLAモデルの限界を克服し、高自由度ロボットの操作を可能にする点で重要である。成功率86.8%という数値は、実用化への期待を高めるが、実世界での検証が今後の課題となる。