日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2410.24164

π0: A Vision-Language-Action Flow Model for General Robot Control

π0: A Vision-Language-Action Flow Model for General Robot Control

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文ロボット基盤モデル・VLA
本論文は、Physical Intelligence社が2024年に発表したπ0(pi-zero)を提案したものである。π0は、視覚と言語の入力からロボットの動作を直接生成するVision-Language-Action(VLA)モデルであり、特にフローベースの動作生成を導入した点に新規性がある。従来のVLAモデルは、動作を離散的なトークン列として扱うか、ガウス分布に基づく回帰で連続値を予測していたが、π0は動作生成をフローマッチング(flow matching)として定式化し、より高次元でマルチモーダルな動作分布を表現できるようにした。これにより、多様なロボットプラットフォームやタスクに対して、単一のモデルで汎用的な制御を実現することを目指している。 仕組みの核心は、視覚エンコーダ(ViT)と言語エンコーダ(T5)で入力(画像と指示文)を処理し、それらを融合した表現を条件として、動作シーケンスをフローモデルで生成する点にある。フローモデルは、ノイズから動作を徐々にデノイズする過程で、各ステップで速度場(velocity field)を予測する。訓練時には、動作データにガウスノイズを加え、そのノイズを除去する方向を学習する。推論時には、ランダムなノイズから始めて、学習した速度場に従って数ステップのオイラー法で動作を復元する。このアプローチは、拡散モデルと似ているが、より少ないステップで高品質な動作を生成でき、また動作のマルチモダリティ(同じ指示でも複数の正解動作がある場合)を自然に扱える。さらに、π0は動作をエンドエフェクタのポーズと指の関節角度の連続値として出力し、周波数50Hzで制御する。 画期的な点は、従来のVLAモデルが抱えていた「動作表現の限界」を克服したことである。従来のトークン化ベースの手法(例えばRT-2)は、動作を離散化するため精度が低く、また高周波の制御には不向きだった。一方、回帰ベースの手法は、動作分布が多峰的である場合に平均的な動作しか生成できず、器用な操作(例えば物体を掴む際の微妙な手の動き)が困難だった。π0はフローモデルを用いることで、連続的かつ多峰的な動作分布を表現でき、高精度で滑らかな制御を実現した。また、事前学習として大規模な多様なロボットデータ(約1万時間分)を用い、その後、特定タスクのデータでファインチューニングするというスケーリング戦略も示した。 フィジカルAIにおける位置づけとしては、π0はロボット基盤モデルの先駆けとなる重要な一歩である。その後の研究(例えばπ0.5やOpenVLAなど)に大きな影響を与え、VLAモデルにおける動作生成の標準的な手法としてフローベースのアプローチが広く採用されるきっかけとなった。また、π0は家庭用ロボットや産業用ロボットなど、多様なハードウェアに適用可能な汎用性を示し、ロボットが言語指示に基づいて複雑な操作タスクを実行するための実用的な枠組みを提供した。この論文は、ロボット学習におけるスケーリング則と基盤モデルの可能性を実証し、その後のフィジカルAI研究の方向性を大きく方向づけたと言える。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

著者: Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

分類: cs.LG, cs.RO

原文アブストラクト

Robot learning holds tremendous promise to unlock the full potential of flexible, general, and dexterous robot systems, as well as to address some of the deepest questions in artificial intelligence. However, bringing robot learning to the level of generality required for effective real-world systems faces major obstacles in terms of data, generalization, and robustness. In this paper, we discuss how generalist robot policies (i.e., robot foundation models) can address these challenges, and how we can design effective generalist robot policies for complex and highly dexterous tasks. We propose a novel flow matching architecture built on top of a pre-trained vision-language model (VLM) to inherit Internet-scale semantic knowledge. We then discuss how this model can be trained on a large and diverse dataset from multiple dexterous robot platforms, including single-arm robots, dual-arm robots, and mobile manipulators. We evaluate our model in terms of its ability to perform tasks in zero shot after pre-training, follow language instructions from people and from a high-level VLM policy, and its ability to acquire new skills via fine-tuning. Our results cover a wide variety of tasks, such as laundry folding, table cleaning, and assembling boxes.