日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.05260

一言で変わる行動:言語条件付き身体化推論の実ロボットベンチマーク

One Word, Different Action: A Real-Robot Benchmark for Language-Conditioned Embodied Reasoning

シェア:XThreadsFacebookLINEはてブBluesky

タスクが変わらない場合は行動を維持し、タスクが変わった場合のみ行動を正しく更新する能力を評価する、実ロボット向けの新しいベンチマークを提案した。

詳しい要約

1. どんなもの?

One Word, Different Actionは、言語指示の変化がロボットの行動に与える影響を評価するための実ロボットベンチマークである。物理的な決定状態と実行可能なアクションに基づき、タスクを保持する指示ペアとタスクを変更する指示ペアを用いて、Decision Invariance(タスクが変わらない場合に行動を維持する能力)とDecision Sensitivity(タスクが変わった場合に行動を正しく更新する能力)を同時に評価する。さらに、複数制約の推論と実RGB画像による接地(grounding)も評価する。

2. 先行研究と比べてどこがすごい?

先行研究では、言語指示の変化に対するロボットの応答を個別に評価することが多かったが、本ベンチマークはタスク保持とタスク変更の両方をペアで用いることで、意思決定の不変性と感度を統合的に評価する点が新しい。また、単一制約の指示変更ではモデルが飽和状態にある一方で、複数制約の統合が残る課題であることを示し、評価の焦点を複合的なタスク要求の統合に移している。

3. 技術・手法の肝は?

手法の肝は、物理的な決定状態と実行可能なアクションに基づくベンチマーク設計にある。タスク保持ペアとタスク変更ペアを用意し、Decision InvarianceとDecision Sensitivityを指標として定義する。さらに、複数制約の推論と実RGB画像による接地を評価に含めることで、実世界のロボット動作に近い条件での性能を測定する。

4. どうやって有効だと検証した?

有効性の検証は、現代のモデル(具体的なモデル名は要旨に記載なし)をベンチマークに適用し、単一制約の指示変更ではほぼ飽和状態にあるが、複数制約を統合する必要がある場合にはいくつかのモデルが顕著に性能を落とすことを実験で示した。これにより、ベンチマークが現在のモデルの課題を浮き彫りにできることを実証している。

5. 議論はある?

議論としては、要旨からは、単一制約の指示変更の認識はほぼ解決されているが、複数のタスク制約を一つの実行可能な決定に統合する能力が依然として課題であると考察されている。また、実RGB画像による接地の評価が含まれるが、その詳細な結果や限界については要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、言語条件付けロボット制御やembodied reasoningの分野の定番論文(例えば、Language-conditioned imitation learningやVision-Language-Action models)が関連する。具体的には、RT-1やRT-2、CLIPortなどのモデルや、ALFREDベンチマークなどが考えられるが、要旨からは不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yiwei Liu, Luwei Yang, Shunbo Lei

分類: cs.RO

原文アブストラクト

Natural-language instruction changes can directly alter robot behavior. A reliable embodied system should preserve its action when the task is unchanged and update it correctly when the task itself changes. We introduce One Word, Different Action, a real-robot benchmark built on physical decision states and executable actions, using task-preserving and task-changing instruction pairs to jointly evaluate Decision Invariance and Decision Sensitivity, with further evaluation under multi-constraint reasoning and real-RGB grounding. Experiments show that modern models are near saturation on single-constraint instruction changes, yet several models degrade noticeably when multiple task constraints must be integrated into one executable decision. These results suggest that the more salient remaining challenge is no longer recognizing an isolated instruction change, but reliably composing multiple task requirements into a correct robot action decision.

関連論文