何が起きたか

arXivに2025年8月27日付で掲載された論文(識別番号2508.20072v4)において、研究チームは「Discrete Diffusion VLA」と名付けた新しいVLAモデルを発表した。このモデルは、動作チャンクを離散化し、離散拡散パターンを用いて統一トランスフォーマーバックボーン内で段階的改善を行う。評価では、LIBEROで平均成功率96.4%、SimplerEnv-Fractalで視覚マッチング71.2%、SimplerEnv-Bridgeで総合54.2%を達成した。さらに、AgileX Cobot Magicプラットフォーム上で2つの実ロボット評価を実施した。

詳細

従来のVLAモデルは、固定の左から右への順序で自己回帰的に動作を生成するか、バックボーンの外側に別の拡散ヘッドを装着していた。前者は性能が低く、後者は情報経路を断片化し、統一的でスケーラブルなアーキテクチャを妨げる問題があった。提案手法は、動作チャンクを離散化し、離散拡散パターンでモデル化することで、統一トランスフォーマーバックボーン内で段階的改善を保持する。 この手法は、適応的復号順序を採用し、高信頼度の動作要素を先に解決し、その後により困難な要素を処理する。また、二次再マスキングを用いて不確実な予測を再検討し、堅牢な誤り訂正を可能にする。この設計により、事前学習済みの視覚言語プリエンティブが保持され、並列復号がサポートされ、効率が向上する。 分布外テストでは、LIBERO-Goalにおいて、言語劣化はわずか0.8%であり、並列復号の8.0%を下回った。視覚劣化は20.4%で、連続拡散の29.0%を下回った。これにより、事前学習済みの視覚言語能力の保持が実証された。

Key Facts

論文はarXivに2025年8月27日付で掲載された(識別番号2508.20072v4)。[1]
提案手法は「Discrete Diffusion VLA」と呼ばれ、動作チャンクを離散化し、離散拡散パターンでモデル化する。[1]
LIBEROで平均成功率96.4%を達成した。[1]
SimplerEnv-Fractalで視覚マッチング71.2%を達成した。[1]
SimplerEnv-Bridgeで総合54.2%を達成した。[1]
LIBERO-Goalの分布外テストで、言語劣化は0.8%、視覚劣化は20.4%だった。[1]
並列復号では言語劣化8.0%、連続拡散では視覚劣化29.0%だった。[1]
AgileX Cobot Magicプラットフォーム上で2つの実ロボット評価を実施した。[1]

なぜ重要か

この研究は、VLAモデルの動作生成における拡散手法の適用方法に新たな選択肢を提供する。統一トランスフォーマー内で離散拡散を用いることで、事前学習済みの視覚言語能力を保持しつつ、並列復号による効率化を実現しており、ロボットの動作生成の性能と堅牢性向上に寄与する可能性がある。