何が起きたか

arXivは2026年9月20日、論文「EmoPose: Vision-Language Model Guided Emotion-Aware Gesture Generation for Humanoid Robots」を公開した。論文は、言語、対話履歴、任意の視覚文脈を受けて、コミュニケーション種別、ライブラリ変種、強度、発話アンカーを含む順序付きジェスチャー計画を選ぶ枠組みを提示している。物理機体ではUnitree G1上で29種類の著者実装バリエーションを実現し、さらに4か所を巡る実験で中断を含むナレーション、カメラに基づく対話、移動を示したとしている。

詳細

論文は、ロボットが保有する動作ライブラリを基礎に、14自由度の関節目標値の供給源を定義している。Pose Studioは自動軌道生成、MuJoCoでのプレビュー、新しいライブラリエントリとVLMガイドの自動同期を担う。ロボット側の決定的モジュールは、計画の検証、軌道構築、ジェスチャーのスケジューリング、キュー管理と割り込み管理を行う構成である。 評価では、EmoPose-Bench上でStructured GPT-5.5 planningがEasy tierで98.25±0.52%、全体で76.50±0.54%に達し、同じモデルを使った直接ラベル指示を上回ったとしている。論文は、対話文脈の利用と順序付きの複数行動の合成も確認したと述べている。

Key Facts

arXivは2026年9月20日、論文「EmoPose: Vision-Language Model Guided Emotion-Aware Gesture Generation for Humanoid Robots」を公開した。[1]
EmoPoseは、言語、対話履歴、任意の視覚文脈を入力に、順序付きジェスチャー計画を選ぶ枠組みである。[1]
論文は、ロボット所有の動作ライブラリと14-DoF joint targetsを用いる設計を示した。[1]
Pose Studioは自動trajectory生成、MuJoCo preview、新規ライブラリエントリとVLM guideの自動同期を担う。[1]
物理機体ではUnitree G1上で29種類の著者実装バリエーションを実現したとしている。[1]

本紙の見方

EmoPoseの新規性は、感情表現を伴うジェスチャー生成を、基盤モデルの自由生成に任せ切るのでなく、ロボット所有の動作ライブラリとロボット側の決定的制御でつなぎ直した点にある。論文はコミュニケーション種別、ライブラリ変種、強度、発話アンカーを選ぶだけの実行可能な意味表現を置き、生の関節指令はVLMに渡さない。ここは、対話の柔軟性と実機の再現性を両立させようとする設計であり、単なるジェスチャー生成よりも制御面の境界を明確にしている。 本紙の関連記事であるUnitreeがG1+と新基盤モデルを発表(2026-09-19)は、Unitreeが人型ロボットG1+と新世代の汎用人型ロボット基盤モデルを公表したと伝えていた。今回の論文は、その直後にUnitree G1実機上で29種類の著者実装バリエーションを動かした点で接続するが、論文の焦点はモデル単体ではなく、ライブラリ、Pose Studio、ロボット側モジュールまで含めた実行系にある。言い換えれば、基盤モデルの性能だけではなく、実機で崩れない制御境界の設計が次の論点になっているとみられる。 業界構造への含意は、対話型ヒューマノイドで重要になるのが、生成モデルの言語能力そのものより、身体ごとの動作ライブラリ、14自由度の目標値管理、軌道生成、割り込み処理をどう標準化するかに移る点である。EmoPoseは、MuJoCoでの事前確認から物理機体への反映までを同じ流れで扱っており、学習済みモデル、シミュレーション、実機制御の接続点をどこに置くかが競争軸になりうる。未確定の論点は、29種類のバリエーションがどの程度一般化可能か、Easy tierと全体76.50%の差がどの失敗要因に由来するか、そして他の機体で同じライブラリ構造を再利用できるかである。

なぜ重要か

論文は、Unitree G1実機で29種類の表現バリエーションを動かし、VLMが生の関節指令を直接出さない構成を示した。これは、人型ロボットで対話表現を実装する際に、モデルの自由度よりもロボット側の制御境界と動作ライブラリが重要になる可能性を示す。

日本への影響

Unitree G1のような実機で、14自由度の関節目標値と動作ライブラリを前提にした設計が示されたことで、日本のヒューマノイド開発でも、対話モデル単体ではなく、実機側の軌道生成・割り込み・ライブラリ管理を含む制御基盤の整備が焦点になりうる。