何が起きたか
研究チームは、器用な操作のための汎用ロボットポリシーRLDX-1を発表した。RLDX-1は、異種モダリティを統合するMulti-Stream Action Transformer (MSAT)アーキテクチャを採用し、シミュレーションと実世界のタスクで評価された。ALLEXヒューマノイドタスクでは成功率86.8%を記録し、比較対象のπ0.5とGR00T N1.6が約40%だったのに対し、優位性を示した。
詳細
RLDX-1は、視覚言語行動モデル(VLA)の課題を解決するために開発された。VLAは事前学習済みの視覚言語モデルから汎用性を継承するが、動作認識、長期記憶、物理センシングなどの機能が不足している。RLDX-1は、モダリティ固有のストリームとクロスモーダルな自己注意を備えたMSATにより、これらの機能を統合する。さらに、稀な操作シナリオのためのデータ合成、人間らしい操作のための学習手順、リアルタイム展開のための推論最適化などのシステム設計を組み合わせている。
Key Facts
| RLDX-1はMulti-Stream Action Transformer (MSAT)アーキテクチャを採用し、異種モダリティを統合する。 | [1] |
| RLDX-1はALLEXヒューマノイドタスクで成功率86.8%を達成した。 | [1] |
| 比較対象のπ0.5とGR00T N1.6は約40%の成功率だった。 | [1] |
| RLDX-1はシミュレーションと実世界のタスクで、最近のフロンティアVLAを一貫して上回った。 | [1] |
| RLDX-1はデータ合成、学習手順、推論最適化などのシステム設計を組み合わせている。 | [1] |
なぜ重要か
RLDX-1は、VLAモデルの限界を克服し、高自由度ロボットの操作を可能にする点で重要である。成功率86.8%という数値は、実用化への期待を高めるが、実世界での検証が今後の課題となる。