日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2304.13705

Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文ロボット基盤モデル・VLA
本論文は、低コストのハードウェアを用いて、人間の両腕による細かい操作を模倣学習で実現するための枠組みを提案した。具体的には、遠隔操作で収集したデモンストレーションから、行動クローニング(ACT: Action Chunking with Transformers)と呼ばれるTransformerベースのポリシーを学習する。新規性は、高価な産業用ロボットや精密なセンサに依存せず、市販の部品で構成した双腕ロボットプラットフォーム(ALOHA)と、その上で安定した長時間の操作を可能にするアルゴリズムの組み合わせにある。 仕組みの核となるのは、ACTの「行動チャンク」と「閉ループでの再実行」である。従来の模倣学習では、各時刻で1つの動作を予測するが、ACTは未来の一定区間(例えば10ステップ)の動作をまとめて予測する。これにより、予測のばらつきが抑えられ、滑らかで一貫した動作が生成される。また、学習時には、現在の観測に加えて、過去の動作系列を条件として与えることで、動作の時間的な文脈を捉える。推論時には、予測した動作チャンクを実行し、その区間が終わるたびに最新の観測から再予測する。この「実行と再計画」のサイクルにより、環境の変化や誤差に頑健になる。ハードウェア面では、ALOHAは2本の6自由度アームを備え、各関節に安価なサーボモータとエンコーダを用いる。遠隔操作は、マスター側のアームを人間が動かし、その関節角度をそのままフィードバックとしてスレーブ側に転送する方式で、高精度な力覚センサを必要としない。 画期的だった点は、従来の模倣学習が単純な把持や押すなどの短いタスクに限られていたのに対し、本手法は「靴ひもを結ぶ」「Tシャツをたたむ」「バッテリーを交換する」といった、数秒から数十秒に及ぶ複雑な両腕操作を、低コストなシステムで高い成功率で達成したことである。従来は、このような細かい操作には高精度なロボットと専用の制御アルゴリズムが必要とされ、模倣学習ではデータ量や分布ずれの問題で困難だった。ACTは、行動チャンクとTransformerの表現力により、デモンストレーションの多様性を吸収し、実環境での汎化を可能にした。また、データ収集のコストを大幅に下げたことで、研究コミュニティが再現しやすくなった。 フィジカルAIの観点では、本論文はロボット基盤モデルやVLA(Vision-Language-Action)モデルの発展における重要な基盤となった。ACTは、後のRT-2やOpenVLAなどの大規模VLAモデルにおいて、動作生成の出力ヘッドや微調整のベースラインとして広く採用された。また、ALOHAプラットフォームは、データ収集の標準的な手段として普及し、多くの後続研究がこの枠組みを拡張して、より長いタスクや多様な物体操作、言語条件付きの制御へと発展させた。特に、低コストで再現可能な点は、ロボット学習の民主化に貢献し、実世界でのスケーラブルなデータ収集と学習の可能性を示した。現在のフィジカルAI研究において、模倣学習とTransformerを組み合わせたこのアプローチは、ロボットの器用な操作を実現するための標準的な手法の一つとして位置づけられている。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

著者: Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn

分類: cs.RO, cs.LG

原文アブストラクト

Fine manipulation tasks, such as threading cable ties or slotting a battery, are notoriously difficult for robots because they require precision, careful coordination of contact forces, and closed-loop visual feedback. Performing these tasks typically requires high-end robots, accurate sensors, or careful calibration, which can be expensive and difficult to set up. Can learning enable low-cost and imprecise hardware to perform these fine manipulation tasks? We present a low-cost system that performs end-to-end imitation learning directly from real demonstrations, collected with a custom teleoperation interface. Imitation learning, however, presents its own challenges, particularly in high-precision domains: errors in the policy can compound over time, and human demonstrations can be non-stationary. To address these challenges, we develop a simple yet novel algorithm, Action Chunking with Transformers (ACT), which learns a generative model over action sequences. ACT allows the robot to learn 6 difficult tasks in the real world, such as opening a translucent condiment cup and slotting a battery with 80-90% success, with only 10 minutes worth of demonstrations. Project website: https://tonyzhaozh.github.io/aloha/

関連論文ロボット基盤モデル・VLA