フィジカルAIとは

フィジカルAI(Physical AI)は、現実の物体に触れて働きかけるAIを指します。カメラやセンサで周囲を捉え、何をすべきかを判断し、モーターを動かして実際に物を動かす——ここまでを一つのAIが担います。日本語では「身体性AI」、英語圏の研究分野としては Embodied AI とほぼ同じ対象を指します。

「AIがロボットを動かす」という発想自体は新しくありません。産業用ロボットは半世紀以上前から工場で動いています。違いは、動作を人が一つずつ教え込まなくてよくなりつつある点です。従来の産業用ロボットは、決められた位置に決められた順序で動くよう人がプログラムします。少しでも部品の位置がずれれば失敗します。フィジカルAIが目指すのは、「棚の赤いコップを取って」と言われて、見たことのない棚と見たことのないコップでも成立させることです。

生成AIと何が違うのか

同じ「AI」でも、扱う対象が現実世界になると設計上の制約が大きく変わります。

生成AI(LLM・画像生成)フィジカルAI
入力テキスト、画像カメラ画像、力・トルク、関節角、触覚
出力テキスト、画像関節やモーターへの動作指令
失敗のコスト書き直せばよい物が壊れる、人が怪我をする
応答の速さ数秒待てる制御周期は数ミリ秒〜数十ミリ秒
学習データインターネット上に大量にある誰かが実際にロボットを動かして集めるしかない
評価ベンチマークで採点できる実機で何回成功したかを数えるしかない

とくに効くのがデータの差です。言語モデルはウェブ上の文章を使えますが、「この形のコップをこの角度でつかむと滑る」という情報はインターネットに落ちていません。だからこの分野では、遠隔操作で人がロボットを動かして記録する、UMIのような手持ち治具で人の作業を直接記録する、シミュレータの中で大量に試すといった、データを作る手段そのものが競争領域になっています。

なぜ2020年代後半に動き出したのか

理由は大きく3つです。

  • 基盤モデルの転用: 大量データで一つの大きなモデルを学習させると、個別に作り込むより汎用的に効く——という基盤モデルの考え方が、言語や画像で実証されました。その手法をロボットの動作に持ち込んだのがVLA(Vision-Language-Action)モデルです。
  • シミュレータとGPU: 物理シミュレータが速くなり、数千体のロボットを並列に動かして試行錯誤させられるようになりました。現実で1年かかる試行を数時間に圧縮できます(Sim2Real)。
  • ハードの手が届く価格になったこと: 四足歩行ロボットや人型ロボットが研究室で買える価格帯に降りてきて、ソフトウェア側の研究者が実機を触れるようになりました。

なお「フィジカルAI」という呼び方自体は、半導体・計算基盤の側から産業カテゴリとして押し出された経緯があり、学術用語というより産業側の言葉です。研究論文では Embodied AI、Robot Learning、Robot Foundation Model といった語のほうが多く使われます。

中身はどうなっているか

フィジカルAIのシステムは、おおまかに三層で語られます。

見る(知覚)

カメラ、深度カメラ、LiDAR、触覚センサで周囲と自分の状態を取り込みます。自分の関節がどこにあるかを感じる感覚は固有受容感覚と呼ばれます。

決める(方策)

「この状況で次にどう動くか」を出力する部分。ここが近年もっとも変わったところで、模倣学習や強化学習で学習されたVLAや拡散ポリシーが使われます。頭の中で先の展開を予測してから動く世界モデルの研究も活発です。

動かす(制御)

出力された指令を実際のモーターに落とす部分。人や物にぶつかったときに硬く突っ張らないための力制御やインピーダンス制御、脚ロボットの全身制御が関わります。ここは学習だけでなく、古典的な制御理論が現役で効いている領域です。

扱う課題は、腕で物を扱うマニピュレーションと、体ごと移動するロコモーションに大別されます。

まだできていないこと

期待が先行しやすい分野なので、現時点の限界も押さえておく価値があります。

  • 汎化: 学習した環境から少し外れると成功率が落ちます。照明、床の色、物の置き方といった、人間なら気にしない差でつまずきます。
  • 長い手順: 「洗濯物をたたむ」のように十数手続く作業は、途中の一手を外すと復帰できないことが多く、失敗からの立て直しが弱点です。
  • 速度と耐久: デモで動くことと、工場で1日8時間動き続けることの間には大きな差があります。
  • 安全の証明: 人と同じ空間で動かすには、うまく動くことだけでなく「危険なことをしない」ことを説明できなければなりません。

どこから実装が進むか

現場では、失敗しても被害が小さく、作業のばらつきが小さいところから入るのが定石です。物流の仕分けやデパレタイズ、製造の外観検査や部品供給、施設内の搬送といった領域が先行しています。介護や農業のように環境が一定でない現場では、直接介助や収穫そのものより、配膳・搬送・洗濯といった周辺業務から着手する例が見られます。

本紙では、こうした動きをニュースで日々追い、企業ごとの動きを企業DB、機体の仕様をRobot DB、技術の元になった論文を論文DBに整理しています。

ヒューマノイドと同じ意味ではない

「フィジカルAI」と聞いて人型ロボットを思い浮かべる人は多いのですが、この二つは別の階層の話です。フィジカルAIは中身(頭脳)を指す言葉で、ヒューマノイドは器の形を指す言葉です。フィジカルAIを載せた四足ロボットも、アーム一本の据え置き機も、自動搬送車もあります。

人型が注目を集めるのは、世界が人間向けに作られているからです。階段、ドアノブ、工具、机の高さ。専用の設備に合わせて環境を改修するより、人の形に合わせたほうが導入が早い場面があります。一方で人型は、重心が高く不安定で、可動部が多く、コストも保守負担も大きい。平らな床で決まった物を運ぶだけなら、車輪付きの機体のほうが速くて安く壊れにくいというのは、今も変わりません。形は目的から決まります。

似た言葉の使い分け

語どこで使われるか指すもの
フィジカルAI産業・ビジネス側現実世界で動くAI全般。呼び名としては新しい
Embodied AI(身体性AI)学術論文身体を持つ知能。研究分野としてはこちらが古くからの呼称
ロボット基盤モデル技術寄り多様なタスク・機体に効く大規模モデル。VLAなどの総称
具身智能中国語圏Embodied AI の中国語訳。中国企業の発表で頻出

海外や論文を追うときは、この対応を頭に置いておくと情報源が広がります。本紙が中国語圏のニュースも扱うのは、この分野で「具身智能」として発表される情報量が大きいためです。

よくある誤解

「フィジカルAIが来れば、既存の産業用ロボットは置き換わる」 そうはなりません。同じ物を同じ位置で高速に扱う工程では、決め打ちでプログラムされた産業用ロボットのほうが速く、安く、確実です。フィジカルAIが効くのは、品目や置き方が毎回変わるためにプログラムしきれなかった工程です。置き換えではなく、これまで自動化できなかった領域への拡張と見るのが実態に近いところです。

「デモで動いているなら、もう現場で使える」 公開される映像は成功した試行です。現場で問われるのは、成功率が99%あるか、8時間動き続けるか、失敗したときに人が復旧できるか、といった別種の指標です。この差が、発表から実装までの数年になります。

「大量のデータを集めれば解決する」 データ量が効くのは事実ですが、どんなデータを集めるかの設計が先にあります。同じ作業を1万回記録しても、置き方のばらつきが無ければ汎化しません。

本紙での追い方

本紙は、企業の発表・当局資料・論文といった一次情報を起点に、日々の動きをニュースにまとめています。企業ごとの資金調達や提携は企業DB、機体の仕様はRobot DB、技術の裏付けとなる論文は論文DB、分野を俯瞰する読み物はコラムに整理しています。