日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.09451

TempoBridge: 視覚言語行動ポリシーのための言語誘導テンポ制御

TempoBridge: Language-Guided Tempo Control for Vision-Language-Action Policies

シェア:XThreadsFacebookLINEはてブBluesky

凍結したVLA表現を利用し、指示中のテンポ手がかりに応じて動作を調整する軽量フレームワークを提案。追加のテンポ条件付き実演や微調整なしで、LIBEROタスクのテンポ成功率を52.6%から89.7%に改善した。

詳しい要約

1. どんなもの?

- Vision-Language-Action (VLA) モデル向けの軽量フレームワーク TempoBridge を提案。 - 指示文に含まれる tempo cue(速く/遅くなど)に応じて動作を調整する。 - 追加の tempo 条件付きロボットデモや base-policy の fine-tuning を必要としない。 - 凍結した VLA 表現を利用し、各タスクフェーズで動作を変調する。

2. 先行研究と比べてどこがすごい?

- 従来の VLA は「何をするか」の理解に優れるが「どう実行するか」の制御は限定的。 - 既存手法は tempo 条件付きデモや fine-tuning を要することが多い。 - TempoBridge は追加デモ・fine-tuning なしで tempo 制御を実現。 - LIBERO で Tempo Success Rate を 52.6% から 89.7% に改善し、タスク成功率も高く維持。

3. 技術・手法の肝は?

- 凍結した VLA 表現から tempo cue を抽出。 - contextual VLM 表現を用いて tempo cue を取得。 - causal phase router でタスク進捗と tempo cue を整合。 - 実行中に nominal motion command を変調する。

4. どうやって有効だと検証した?

- LIBERO タスクで評価。 - canonical tempo 指示下で Tempo Success Rate が 52.6%→89.7% に向上。 - タスク成功率を高く維持。 - tempo cue がない場合はベースラインに近い性能を保持。 - 未見の tempo 表現にも追加学習なしで汎化。 - 実機ロボット実験でも言語条件付き tempo 変調を実証。

5. 議論はある?

- 要旨からは不明。 - 限界や失敗事例、計算コスト、他タスクへの適用性などは記述されていない。

6. 次に読むべき論文は?

- 要旨で参照・比較されている研究は明示されていない。 - 関連手法として Vision-Language-Action (VLA) モデル、LIBERO ベンチマーク、VLM 表現を用いたロボット制御の研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yeonseo Lee, Hyosup Shin, Guebin Hwang, Sungho Jo

分類: cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models are effective at understanding what task to perform, but provide limited control over how it should be executed, such as moving quickly or slowly. We introduce TempoBridge, a lightweight framework that uses frozen VLA representations to modulate actions according to tempo cues in the instruction at each task phase, without additional tempo-conditioned robot demonstrations or tempo-specific base-policy fine-tuning. TempoBridge extracts tempo cues from contextual VLM representations, aligns them with task progress through a causal phase router, and modulates nominal motion commands during execution. Across LIBERO tasks, TempoBridge improves Tempo Success Rate from 52.6% to 89.7% under canonical tempo instructions while retaining high task success. It also preserves near-baseline performance when no tempo cue is present and generalizes to unseen tempo expressions without additional training. Experiments on a physical robot further demonstrate language-conditioned tempo modulation in real-world manipulation.

関連論文

PR本紙発行元 EmplifAI