日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
歩行arXiv:2610.05819

四足歩行ロボットによる固定されていない積載物の多目的強化学習を用いた運搬

Transporting Unsecured Stacked Payloads with a Quadrupedal Robot via Multi-Objective Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

四足ロボットがセンサなしで不安定な積み重ね箱を運ぶため、歩行性能と荷物安定性のトレードオフをオンラインで適応する多目的強化学習手法を提案し、実機で斜面や段差へのゼロショット転移を実証した。

詳しい要約

1. どんなもの?

- 四足歩行ロボットによる、固定されていない積み重ね荷物の運搬を扱う研究。 - 荷物は edgeless torso-mounted board 上に載せ、専用の payload sensors や active carrier mechanisms を使わない。 - 不整地で locomotion performance と payload stability のトレードオフを両立させる必要がある。 - 提案手法は Payload-Adaptive Multi-Objective Reinforcement learning for Transportation (PAMORT)。 - シミュレーションと実機 Unitree Go2 で検証。

2. 先行研究と比べてどこがすごい?

- 従来は固定荷物や専用センサ・能動機構を前提とする運搬が多く、unsecured stacked payloads は難しい。 - 単一目的の baseline と比べ、異なる payload configurations で同等以上の輸送成功率。 - 訓練時は2箱のみだが、未見の3箱スタックにも対応。 - 実機で slopes と steps へ zero-shot transfer し、平均成功率 0.850 対 baseline 0.675。 - proprioception のみから locomotion--payload trade-off をオンライン適応できる点が新しい。

3. 技術・手法の肝は?

- 複数目的の base policy を preference vector で条件付けして訓練。 - preference vector は locomotion と payload-stability の reward groups の重みを表す。 - 凍結した base policy 上で weight adjuster を訓練。 - weight adjuster は proprioception から preference をオンラインで適応。 - これにより荷物の状態を直接センシングせずに安定性と移動性能のバランスを調整。

4. どうやって有効だと検証した?

- シミュレーションで異なる payload configurations を評価。 - 2箱のみで訓練し、未見の3箱スタックでも評価。 - 単一目的 baseline と輸送成功率を比較。 - 実機 Unitree Go2 で slopes と steps に zero-shot transfer を検証。 - 8タスクで平均成功率 PAMORT 0.850、baseline 0.675。

5. 議論はある?

- 専用センサや能動機構なしで unsecured stacked payloads を運搬できる可能性を示す。 - proprioception に基づくオンライン適応が有効であることを示唆。 - 訓練より難しい、または同等の難易度の slopes と steps へ zero-shot transfer が可能。 - 限界や失敗条件、他の荷物形状への一般化については要旨からは不明。 - 実世界での安全性や長期運用の議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている単一目的 baseline の詳細。 - Multi-Objective Reinforcement Learning の一般的な手法。 - preference vector や weight adjuster を用いる関連研究。 - Unitree Go2 を用いた legged robot の payload transportation 研究。 - unsecured payload や stacked payload の運搬に関する先行研究。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Nobuo Namura, Masayuki Hiromoto, Kento Uemura, Hironobu Sasaki, Kanata Suzuki

分類: cs.RO, cs.LG

原文アブストラクト

Transporting unsecured payloads with legged robots over uneven terrain requires balancing locomotion performance and payload stability, since aggressive motion can destabilize the payload even when the robot remains stable. We study quadrupedal transportation of unsecured stacked boxes on an edgeless torso-mounted board without dedicated payload sensors or active carrier mechanisms. To address this trade-off, we propose Payload-Adaptive Multi-Objective Reinforcement learning for Transportation (PAMORT). PAMORT trains a multi-objective base policy conditioned on a preference vector that weights locomotion and payload-stability reward groups, then trains a weight adjuster on the frozen policy to adapt this preference online from proprioception. In simulation, PAMORT achieves comparable or better overall transportation success than a corresponding single-objective baseline across different payload configurations, including an unseen three-box stack, despite training only with two boxes. Real-world experiments on a Unitree Go2 demonstrate zero-shot transfer to slopes and steps at or beyond the training difficulty, with mean success rates of 0.850 for PAMORT and 0.675 for the baseline across eight tasks. These results demonstrate robust unsecured-payload transportation with online adaptation of the locomotion--payload trade-off from proprioceptive information.

関連論文

PR本紙発行元 EmplifAI