何が起きたか
研究チームは2026年8月26日、ロボット操作のための説明可能な行動モデル「LM-X」を発表した。LM-Xは、タスク・イベント・モーターの3スケールで予測を明示的に監督し、制御に内在する説明を実現する。50のランダム化RoboTwin2.0タスクで74.1%の成功率を達成し、GR00T N1.7の55.4%を上回った。7つの実ロボットタスクでも68.6%対50.7%と優位に立った。
詳細
LM-Xは、return-to-go (RTG)で可視のタスク進捗を、event-to-go (ETG)で次の意味的遷移を、不均一分散のアクションフローで局所的信頼性を推定する。これら3つの明示的に監督された信号がオンラインで生成され、アクション生成を直接条件付ける。20日間の事前学習(64基のNVIDIA B200 GPUを使用)の前に、5タスクの事前学習ゲートで設計を検証し、アクションのみのバックボーンに対して成功率を16.0ポイント、最強の単一ヘッド変種に対して10.8ポイント向上させた。その後、2万時間以上の実ロボット軌道(1,000時間以上の失敗ロールアウトを含む)で学習した。
Key Facts
| LM-Xは、タスク・イベント・モーターの3スケールで予測を明示的に監督する説明可能な行動モデルである。 | [1] |
| 50のランダム化RoboTwin2.0タスクで74.1%の成功率を達成し、GR00T N1.7の55.4%を上回った。 | [1] |
| 7つの実ロボットタスクで68.6%の成功率を達成し、50.7%のGR00T N1.7を上回った。 | [1] |
| 事前学習には64基のNVIDIA B200 GPUを使用し、20日間のランを実施した。 | [1] |
| 2万時間以上の実ロボット軌道(1,000時間以上の失敗ロールアウトを含む)で学習した。 | [1] |
本紙の見方
LM-Xの核心は、説明可能性を制御に内在させる点にある。従来のVLAポリシーは、単一のアクションターゲットにタスク進捗・中間意図・局所的信頼性を暗黙に吸収させ、実行中はこれらの制御状態が隠れたままだった。LM-Xは、RTG・ETG・不均一分散のアクションフローという3つの明示的に監督された信号をオンラインで生成し、アクション生成を直接条件付けることで、説明を後付けではなく制御の一部とした。 この設計は、生物学的感覚運動制御の機能原理に触発されているが、解剖学的対応は主張していない。5タスクの事前学習ゲートで設計を検証し、アクションのみのバックボーンに対して16.0ポイント、最強の単一ヘッド変種に対して10.8ポイントの改善を確認した。これは、説明可能性の追加が性能を損なわないどころか、向上させることを示す。 業界構造への含意として、VLAポリシーの説明可能性は、実世界展開での信頼性と安全性に直結する。LM-Xは、失敗ロールアウトを含む2万時間以上の実ロボット軌道で学習しており、失敗データの活用が性能向上に寄与した可能性がある。これは、データ収集とモデル学習のループを強化するものであり、ロボット操作の一般化に向けた重要な一歩となる。 未確定の論点として、LM-Xのスケーラビリティと汎用性が挙げられる。50タスクと7つの実ロボットタスクでの検証は限定的であり、より多様な環境やタスクでの性能は未知数である。また、RTGやETGの定義がタスクに依存する可能性があり、タスク記述の自動生成や転移学習の課題が残る。さらに、計算コスト(64基のB200で20日間)は大規模であり、実用化には効率化が必要となる。
なぜ重要か
LM-Xは、ロボット操作における説明可能性を制御の一部として実装し、性能を向上させた点で画期的である。これは、実世界でのロボット展開において、人間が内部状態を理解しやすくし、信頼性と安全性を高める可能性を秘めている。