中国ヒューマノイド業界の読み方:主要プレイヤーの類型と量産・価格の強さの秘密
中国のヒューマノイド業界は、EV大手、ロボット専門企業、ネット大手の3類型に分かれ、それぞれ異なる強みを持つ。量産と価格競争力の源泉は、サプライチェーン、政府支援、データ収集の3点にある。最新の具体的数値は流動的だが、業界全体として急速な進化を遂げている。
世界のフィジカルAIを、日本語で。
中国のヒューマノイド業界は、EV大手、ロボット専門企業、ネット大手の3類型に分かれ、それぞれ異なる強みを持つ。量産と価格競争力の源泉は、サプライチェーン、政府支援、データ収集の3点にある。最新の具体的数値は流動的だが、業界全体として急速な進化を遂げている。
Sim2Realは、ロボットやAIがシミュレーション環境で学習し、その知識を実世界で応用する手法です。しかし、シミュレーションと現実の差(リアリティギャップ)が大きな壁となります。この記事では、その難しさと克服するための主要なアプローチを解説します。
ロボットが物を掴んだり、繊細に扱うには、視覚だけでは不十分で、触覚センサーが欠かせません。触覚センサーは、接触の有無、圧力の分布、滑り、温度などを検出し、ロボットに『感触』を与えます。これにより、卵を割らずに掴む、ネジを正確に回すなどの器用な操作が可能になります。
模倣学習は、先生の手本を見て真似る「弟子入り」方式。強化学習は、試行錯誤しながら報酬を最大化する「迷路探索」方式。それぞれに長所と短所があり、ロボットの用途に応じて使い分けられています。
ロボットの関節を動かす方式には、直接駆動(QDD)、遊星ギア、ハーモニックドライブの3つが代表的です。それぞれに得意な動きと苦手な動きがあり、用途に応じて選ぶことが重要です。本記事では、各方式の特徴を比喩と具体例で解説し、適材適所の考え方を紹介します。
ヒューマノイドは人間と同じ形をしているため、既存の環境や道具をそのまま使える利点があります。一方で、二足歩行や器用な手の実現は技術的に難しく、コストも高いのが現状です。それでも、人手不足や危険作業への応用が期待され、研究開発が加速しています。
VLAモデルは、カメラ映像と言語指示を入力として、ロボットの動作を直接出力するAIです。従来の「認識→計画→制御」の分業を1つのニューラルネットワークに統合し、柔軟なタスク実行を可能にします。この記事では、その仕組みと可能性を初心者向けに解説します。
フィジカルAIは、現実世界の物理的な動きを伴うAIです。従来のAIがデータ分析や文章生成など画面内の作業に特化していたのに対し、フィジカルAIはロボットや自動運転車など、実際に体を持って動くことを目指します。この違いが、私たちの生活や産業のあり方を大きく変える可能性を秘めています。
SWITCHBOT株式会社は、AIパートナーロボット「KATAフレンズ」が福祉用具情報システム(TAIS)に登録されたと発表した。同社はIoTデバイス分野でNo.1ブランドとされる。本社は東京都渋谷区に所在する。
アクチュエータの出力喪失時にも安定歩行を維持する深層強化学習手法が提案された。非対称アクター・クリティック構造と潜在整合損失、学習可能な歩行周波数パラメータにより、故障脚の事前知識なしで適応的な歩行タイミングを実現する。68kgの4脚ロボットで実機検証された。
視覚言語行動(VLA)モデルの強化学習後訓練において、意味表現と行動学習を分離する新フレームワーク「TEMPO」が提案された。事前学習済みの視覚言語バックボーンを凍結し、意味射影層と行動エキスパートを異なる速度で更新することで、性能を向上させる。CALVINベンチマークと実世界タスクで既存手法を上回る成果を示した。
Tacta Systemsは、ロボットハンドを含む3つのパーツからなるシステム「TactaBot」を発表した。ユーザーはこのシステムを使って、ロボットに新しい器用なスキルを教えることができる。高スキル製造作業への応用を目指す。
Nomagicは、倉庫ロボットの真の優位性は生産データにあると述べた。実際の倉庫の複雑さがロボットの実力を試す場だとしている。
外骨格アシスト歩行時の生体力学的適応を調べた研究で、適応は緩やかで個人差が大きく、下肢の運動学的適応は非同期に生じることが示された。代謝応答は不均一で収束しない場合が多く、定常状態の仮定の限界が浮き彫りに。個人レベルの時間的変動解析の重要性が強調された。
GeniWorldは、事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚アクション表現に変換する対話型ワールドモデル。限られた固定シーンのデータのみで学習しても、未見のランダム環境へのゼロショット汎化に成功。ロボットポリシー評価や多様な操作軌道生成にも応用可能。
ロボット操作の基盤モデルであるVision-Language-Action(VLA)の新手法「DyPES-VLA」が提案された。異なるロボット間で共有されるダイナミクス事前知識を学習し、各ロボット固有の動作空間で直接制御を生成する。シミュレーションと実機評価で最先端性能を達成し、LIBEROで98.0%の成功率を記録した。
単眼ビデオから器用なロボット操作のデモを再構築・転移する新フレームワーク「C2Dex」が発表された。物体側の安定した接触を共有表現とし、軌跡レベルの制約と転移ターゲットの両方に活用する。DexYCBとTACOで成功率57.78%と26.67%を達成し、既存手法を大幅に上回った。
MRI対応のマスタースレーブ型ロボットマニピュレータが発表された。流体伝達により手動・デジタル・ハイブリッド・協調の4モードの遠隔操作を実現する。ブタを用いた予備実験で実用性が確認された。
脚式ロボットの敏捷性を高めるため、時間制約付き強化学習と視覚モジュールを統合したフレームワークが提案された。速度追従ではなく位置・時間を直接条件とするポリシーにより、動的ターゲットの捕獲成功率が向上した。シミュレーションから実機への転移性能も改善されたとみられる。
VLAモデルに身体性の移動制約を組み込む階層型フレームワーク「CrossTracer」が提案された。画像平面ウェイポイントを統一インターフェースとし、身体条件付き残差補正で航法トレースを適応させる。ベンチマークでGemini-2.5-Proを10.01ポイント上回り、実機でも有効性を示した。