何が起きたか

研究チームは2026年9月2日、VLAポリシーの頑健性を高める新手法「Evidence-Gated Regularization(EGR)」を発表した。EGRは、マルチモーダルセンサー入力間のスプリアスな相関(モダリティ絡み合い)を低減し、実世界の遮蔽や妨害物に対する耐性を向上させる。シミュレーションでは、全モダリティ利用時の成功率を12.5%から16.4%(+31%)、無情報センサーの破損時には9.4%から16.5%(+75%)、単一センサーへのフォールバック時には2.8%から6.1%(+120%)に改善した。実ロボットでは、物理的妨害物下で成功率を30%から85%(+183%)に向上させた。

詳細

EGRは、フレームごと・センサーごとのタスク関連性シグナルを導出し、低関連性センサーには不変性、高関連性センサーには単一センサー十分性という2つの状態条件付き整合性目的をゲートする。推論時のオーバーヘッドはゼロである。ベンチマークはBEHAVIOR-1Kに基づき、推論のみの診断スイートと47のロールアウトベースのスキルで構成される。実ロボット検証は、2つのKinovaアームと3台のRGBカメラを用いた双腕セットアップと、視覚とGelSight触覚センサーを組み合わせた単腕MELFA ASSISTAセットアップで実施された。

Key Facts

EGRは、モダリティ絡み合いを低減する新しい正則化手法であり、推論時のオーバーヘッドはゼロ。[1]
シミュレーション成功率は、全モダリティで12.5%→16.4%(+31%)、無情報センサー破損時で9.4%→16.5%(+75%)、単一センサーフォールバック時で2.8%→6.1%(+120%)に改善。[1]
実ロボットでは、物理的妨害物下で双腕セットアップの成功率が30%→85%(+183%)、触覚セットアップで55%→70%(+27%)に向上。[1]
ベンチマークはBEHAVIOR-1Kに基づき、推論のみの診断スイートと47のロールアウトベースのスキルで構成。[1]
実ロボット検証は、2つのKinovaアームと3台のRGBカメラを用いた双腕セットアップと、視覚とGelSight触覚センサーを組み合わせた単腕MELFA ASSISTAセットアップで実施。[1]

本紙の見方

今回の提案であるEGRは、VLAポリシーの頑健性を高める手法として、モダリティ間のスプリアスな相関を明示的に扱う点で新規性がある。従来のデータ拡張やドメインランダマイゼーションが入力分布の変化に焦点を当てるのに対し、EGRはセンサーごとのタスク関連性を動的に評価し、学習目的をゲートする。これにより、無情報センサーの破損や単一センサーへのフォールバックといった、実世界で頻繁に発生する状況での性能低下を抑制する。 本手法の核心は、モダリティ絡み合いという問題の定義と、それを解決するための「証拠ゲート」という仕組みにある。シミュレーションでの成功率向上は、特に単一センサーフォールバック時(+120%)と無情報センサー破損時(+75%)で顕著であり、これはEGRが冗長性と頑健性のバランスを学習していることを示唆する。実ロボットでの物理的妨害物に対する改善(+183%)は、シミュレーションと実環境のギャップを埋める上で有望な結果である。 業界構造への含意として、VLAポリシーはロボットの知能化において重要な役割を果たすが、その学習には大量の実データと計算資源が必要である。EGRのような手法は、限られたデモンストレーションデータからより頑健なポリシーを学習することを可能にし、データ効率の向上に寄与する可能性がある。また、モダリティの冗長性を活用することで、センサー故障時のフォールバック戦略を強化できるため、実運用での信頼性向上につながる。 未確定の論点としては、EGRが大規模なVLAモデルや多様なロボットプラットフォームでどの程度スケールするか、また、実世界の多様なノイズや遮蔽パターンに対してどの程度一般化するかが挙げられる。さらに、EGRの効果がモダリティの数や種類に依存するかどうかも検証が必要である。

なぜ重要か

VLAポリシーはロボットの知能化の鍵となるが、実環境での頑健性が課題である。EGRは、センサー故障や遮蔽などの現実的な状況での性能低下を大幅に改善する手法であり、ロボットの実用化を後押しする可能性がある。