日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.11971

CAPABLE: 行動潜在表現による能力認識型ポリシー適応

CAPABLE: Capability-Aware Policy Adaptation via Behavioral Latent Encoding

シェア:XThreadsFacebookLINEはてブBluesky

故障で関節の動作特性が変わっても、VLAポリシーの能力を自己教師ありで推定し、残差強化学習で補正することで、再学習なしにタスク成功率を改善する手法。

詳しい要約

1. どんなもの?

- 視覚言語行動(VLA)ポリシーは、訓練された身体を前提としており、関節の故障により指令された行動の物理的な実行方法が変わると失敗する可能性がある。 - 既存の故障回復手法は、タスク固有の再訓練、故障ラベル、明示的な診断、または特権的な身体情報を必要とすることが多い。 - 本研究では、凍結されたVLAのための統一的な能力認識適応フレームワークCAPABLEを導入する。 - CAPABLEは、自己教師あり能力推論と残差強化学習を統合する。 - 能力とは、各関節が指令された動きを実際にどれだけ実現するか、およびその動きがエンドエフェクタの挙動にどのように寄与するかを指す。 - オンラインで指令応答履歴と運動学から推論する。

2. 先行研究と比べてどこがすごい?

- 既存の故障回復手法は、タスク固有の再訓練、故障ラベル、明示的な診断、または特権的な身体情報を必要とすることが多い。 - CAPABLEは、故障ラベルや故障関節識別子なしで、凍結されたVLAに残差ポリシーを条件付けする。 - 28のLIBEROタスクにおいて、故障訓練から除外されたアクチュエータでの成功率を24.8%から59.3%に向上させた。 - パラメータマッチしたグローバル履歴ベースラインを17.4ポイント上回った。 - 健康な性能を維持する。 - 6関節にわたるleave-one-actuator-out実験により、この転移が1つのアクチュエータに特異的でないことを示した。 - 未見の故障ファミリーへの転移や物理的なFranka Pandaでの回復も実証した。

3. 技術・手法の肝は?

- 自己教師あり能力推論と残差強化学習を統合する。 - 能力を、各関節が指令された動きを実際にどれだけ実現するか、およびその動きがエンドエフェクタの挙動にどのように寄与するかとして定義する。 - オンラインで指令応答履歴と運動学から推論する。 - 時間エンコーダを関節間で共有する。 - Jacobian grounding、cross-joint attention、自己教師あり物理予測を用いる。 - 得られた表現が残差ポリシーを条件付け、VLAアーム行動に有界な補正を加える。 - 故障ラベルや故障関節識別子を必要としない。

4. どうやって有効だと検証した?

- 28のLIBEROタスクで評価。 - 故障訓練から除外されたアクチュエータでの成功率が24.8%から59.3%に向上。 - パラメータマッチしたグローバル履歴ベースラインを17.4ポイント上回った。 - 健康な性能を維持することを確認。 - 6関節にわたるleave-one-actuator-out実験を実施し、転移が1つのアクチュエータに特異的でないことを示した。 - 未見の故障ファミリーへの転移を評価。 - 物理的なFranka Pandaでの回復を実証。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:LIBEROタスク、パラメータマッチしたグローバル履歴ベースライン、leave-one-actuator-out実験、Franka Panda。 - 関連手法:VLAポリシー、残差強化学習、自己教師あり学習、故障回復手法。 - 具体的な論文名は要旨に記載されていないため、同分野の定番としてVLAや故障回復に関する研究を挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Mohammad Khoshnazar, Mohammad Dehghani Tezerjani, Deyuan Qu, Zhiyuan Gao, Yanxiang Zhan, Jeroen Schafer, Andrew Melnik, Qing Yang, Michael Beetz

分類: cs.RO, cs.LG, eess.SY

原文アブストラクト

Vision-language-action (VLA) policies assume the embodiment on which they were trained and can fail when a joint fault changes how commanded actions are physically executed. Existing fault-recovery methods often require task-specific retraining, fault labels, explicit diagnosis, or privileged embodiment information. We introduce CAPABLE, a unified capability-aware adaptation framework for frozen VLAs that integrates self-supervised capability inference with residual reinforcement learning. CAPABLE infers capability, how much of the commanded motion each joint actually realizes and how that motion contributes to end-effector behavior, online from command-response history and kinematics using a temporal encoder shared across joints, Jacobian grounding, cross-joint attention, and self-supervised physical prediction. The resulting representation conditions a residual policy that adds bounded corrections to the VLA arm action without fault labels or faulty-joint identifiers. Across 28 LIBERO tasks, CAPABLE raises success on an actuator excluded from fault training from 24.8% to 59.3%, outperforming a parameter-matched global-history baseline by 17.4 points while preserving healthy performance. Leave-one-actuator-out experiments across six joints show that this transfer is not specific to one actuator, and additional evaluations characterize transfer to unseen fault families and demonstrate recovery on a physical Franka Panda. https://capable-vla.github.io/

関連論文

PR本紙発行元 EmplifAI