日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.21220

ノイズ空間軌道最適化によるワンステップ生成ポリシーの安全なリアルタイム誘導

Safe Real-Time Policy Steering via Noise-Space Trajectory Optimization for One-Step Generative Policies

シェア:XThreadsFacebookLINEはてブBluesky

ワンステップ生成ポリシーの入力ノイズ空間で軌道最適化を行い、衝突回避などの制約を満たしつつリアルタイムにポリシーを誘導する手法INSPOを提案。

詳しい要約

1. どんなもの?

- 生成ロボットポリシーの推論時ステアリング手法INSPOを提案。 - ワンステップ生成ポリシーの入力ノイズ空間で軌道最適化を行い、衝突回避や姿勢維持などの制約を満たす。 - ポリシーが誘起する状態軌道を評価しつつノイズを最適化し、生成行動を直接変更しない。 - 入力分布との整合性を促す正則化項を含み、population-based particle optimizationでオンライン求解。 - 状態・画像ベースのタスク特化ポリシーと汎用vision-language-actionポリシーに適用可能。

2. 先行研究と比べてどこがすごい?

- 既存の推論時ステアリングは反復的なdiffusionやflowプロセスを通じた勾配ガイダンスが主流で、リアルタイム制御には計算コストが高い。 - INSPOはワンステップ生成ポリシーを対象とし、ノイズ空間での軌道最適化により低ランタイムで制約を満たす。 - best-of-Nサンプリングやaction projectionと比較してタスク成功率と制約充足を改善。 - 勾配ガイダンス生成と比べても遜色なく、より低いランタイムで動作。

3. 技術・手法の肝は?

- 推論時ステアリングをポリシーの入力ノイズ空間における軌道最適化問題として定式化。 - 入力ノイズを最適化し、その結果生じる状態軌道で制約を評価。 - ポリシーの入力分布との整合性を促す正則化項を導入。 - population-based particle optimizationによりオンラインで解を探索。 - 生成行動を直接修正せず、ポリシーが誘起する行動空間を探索する点が肝。

4. どうやって有効だと検証した?

- Push-T、Can pick-and-place、LIBERO-Spatialのタスクで評価。 - 状態ベースおよび画像ベースのタスク特化ポリシーと、汎用vision-language-actionポリシーに適用。 - best-of-Nサンプリングおよびaction projectionと比較し、タスク成功率と制約充足が向上。 - 勾配ガイダンス生成と比較して、より低いランタイムで遜色ない性能を示す。

5. 議論はある?

- 要旨からは不明。 - 制約の種類や一般性、計算コストの詳細、失敗事例などに関する議論は要旨では触れられていない。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:gradient-guided generation、best-of-N sampling、action projection。 - 関連手法:diffusion policy、flow matching、vision-language-action policies。 - 同分野の定番:model predictive control、safe reinforcement learning。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Qingyi Chen, Joseph Ruan, Zachary Kingston

分類: cs.RO

原文アブストラクト

Generative robot policies can represent diverse, multimodal behaviors, but adapting pretrained policies to deployment-time constraints such as collision avoidance and orientation maintenance remains challenging. Existing inference-time steering methods typically apply gradient guidance through iterative diffusion or flow processes, which can be computationally expensive for real-time control. We propose INSPO, which formulates inference-time steering of one-step generative policies as trajectory optimization in the policy's input noise space. By optimizing the input noise while evaluating constraints on the induced state trajectory, INSPO searches the policy-induced behavior space without directly modifying generated actions. The optimization includes a regularization term that encourages solutions to remain consistent with the policy's input distribution and is solved online using population-based particle optimization. We evaluate INSPO on state- and image-based task-specific policies and generalist vision-language-action policies across Push-T, Can pick-and-place, and LIBERO-Spatial. INSPO improves task success and constraint satisfaction over best-of-N sampling and action projection, while comparing favorably with gradient-guided generation at lower runtime.

関連論文

PR本紙発行元 EmplifAI