何が起きたか

2026年6月1日にarXivに公開された論文で、拡散型Vision-Language-ActionポリシーにおけるSE(3)姿勢の表現方法を修正する「Lie Diffuser Actor (LDA)」が提案された。LDAはSE(3)上で動作する拡散フレームワークで、左不変SDEによるノイズ注入、接空間でのスコア予測、指数写像によるサンプル引き戻しを特徴とする。CALVIN ABC→Dベンチマークで平均タスク長を3.27から3.51に改善し、実ロボット実験でもベースラインを上回ったと報告されている。

詳細

論文は、拡散型Vision-Language-ActionポリシーがSE(3)姿勢を平坦なR^12ベクトルで表現することによる「ユークリッド誤謬」を指摘する。この近似は、(1)SO(3)制約に違反する多様体ドリフト、(2)座標変換に対する等変性の破れ、(3)過剰な運動コストを伴う非測地線軌道を引き起こすとされる。LDAは左不変SDEでノイズを注入し、接空間でスコアを予測し、指数写像でサンプルを引き戻すことで、多様体ドリフトを構造的に排除し、座標フレーム等変性と測地線最適性を保証する。CALVIN ABC→Dで平均タスク長を3.27から3.51に改善(+7.3%)。実ロボット実験でもベースラインを上回ったとされる。

Key Facts

拡散型Vision-Language-ActionポリシーはSE(3)姿勢を平坦なR^12ベクトルで表現する「ユークリッド誤謬」を犯していると論文は指摘する。[1]
LDAは左不変SDEでノイズを注入し、接空間でスコアを予測し、指数写像でサンプルを引き戻す。[1]
LDAはCALVIN ABC→Dで平均タスク長を3.27から3.51に改善(+7.3%)。[1]
実ロボット実験でLDAはベースラインを上回ったとされる。[1]

なぜ重要か

この研究は、拡散型VLAポリシーの性能を左右する姿勢表現の幾何学的正確性に光を当てるものであり、ロボット操作の精度と信頼性向上に寄与する可能性がある。SE(3)上での拡散フレームワークは、今後のVLAポリシー設計の新たな標準となり得る。