何が起きたか

arxiv.orgは2026-08-26、説明可能なvision-language-action(VLA)基盤モデル「LM-X」を掲載した。LM-Xは、return-to-go(RTG)で進捗と状態品質を、event-to-go(ETG)で次の意味的イベントまでの動作列を、heteroscedastic action-flow varianceで局所的な命令信頼性を扱う設計である。公開された要旨によると、20,000時間超の異種実ロボット軌跡で事前学習され、そのうち1,000時間超は失敗ロールアウトである。

詳細

要旨では、RTGがETGを条件づけ、RTGとETGの双方が行動生成を条件づける構造が示されている。さらに、不確実性はアクション専門家の内部で推定され、説明が後付けではなく制御の一部として組み込まれる設計だと説明されている。 性能面では、LM-XはRoboTwin2.0の50個のランダム化高難度タスクで74.1%の成功率、実機7タスクで73.5%の成功率を示したとされる。比較対象として、GR00T N1.7はそれぞれ55.4%、50.7%だったと記載されている。

Key Facts

LM-Xは説明可能なvision-language-action(VLA)基盤モデルとして提示された。[1]
LM-Xはreturn-to-go(RTG)、event-to-go(ETG)、heteroscedastic action-flow varianceの3信号を直接教師ありで学習する。[1]
20,000時間超の異種実ロボット軌跡で事前学習され、そのうち1,000時間超は失敗ロールアウトである。[1]
RoboTwin2.0の50個のランダム化高難度タスクで74.1%の成功率を示した。[1]
実機7タスクで73.5%の成功率を示し、GR00T N1.7の50.7%を上回った。[1]

本紙の見方

LM-Xの新しさは、VLAモデルに説明変数を後付けするのではなく、RTG、ETG、不確実性推定を制御の内部に組み込んでいる点にある。従来の「刺激から行動へのブラックボックス」を前提にした設計と異なり、進捗、次の意味的イベント、局所的な命令信頼性を同時に学習対象にしているため、モデルの出力は単なる動作列ではなく、制御の途中状態も含む構造になっている。 一方で、これは完全に新規の問題設定というより、長期制御や監視に有効とされてきた進捗推定、イベント構造、uncertaintyを、事前学習段階から結合したものだと読める。したがって焦点は「何を学習したか」よりも、「それら3信号が本当に行動精度の向上に寄与しているか」に移る。要旨上は、20,000時間超の実ロボット軌跡と1,000時間超の失敗データを使っている点が重要で、成功例だけでなく失敗例を含めて信号を整形している構図が見える。 業界構造への含意としては、VLAの競争軸が行動性能だけでなく、説明可能性と異常検知に広がる可能性がある。RoboTwin2.0の50タスクと実機7タスクでGR00T N1.7を上回ったという比較は、ベンチマーク上の優位だけでなく、実機に近い不確実な状況で信号がどこまで機能するかを問う材料になる。ただし、要旨だけではRTG、ETG、分散推定がそれぞれどの程度性能に寄与したのか、どのタスクで失敗警告が効いたのかは分からない。今後は、各信号のアブレーション、実機7タスクの内訳、失敗ロールアウトの性質、推論時の計算負荷を確認する必要がある。

なぜ重要か

発表者の要旨によれば、LM-Xは進捗・イベント・不確実性を制御の内部で扱うため、ロボットが「何をしているか」だけでなく「どの程度確からしいか」を同時に返す設計だ。実機7タスクとRoboTwin2.0の50タスクで比較結果が示されているため、評価軸は単純な成功率だけでなく、失敗前兆をどう捉えるかにも広がる。