何が起きたか

arXivは2026-10-06、「BiGym 2.0: Benchmarking Learned and Agent-Developed Policies for Humanoid Household Manipulation」を掲載した。Unitree G1向けに家庭内操作を評価するベンチマークで、20の家庭内タスクを対象に、単一の全身制御器を使ってデモンストレーションと評価をそろえた。各タスクには人間によるVRデモが60件ずつ用意され、多視点カメラ映像と全身の実行記録が付く。

詳細

このベンチマークでは、vision-language-action fine-tuning、imitation learning、demo-driven reinforcement learning、cold-start coding agentsを、オンライン強化学習の相互作用予算の下で比較している。すべての手法で、同じオンボード視点、固有受容情報、全身制御器を用いたという。 結果として、vision-language-action fine-tuningが9タスク平均で最も高く、agent-developed programsはdemo-driven reinforcement learningの全ベースラインをこの平均で上回り、両手到達で優位だった。一方で、cross-workspace stackingは未解決で、pick-boxではπ0.5が低いままであり、multi-object transportはimitation learning、demo-driven reinforcement learning、coding agentsのいずれにとっても難しいとされた。環境、ヒューマンデモ、評価トレースはオープンソース化され、GitHubで公開された。

Key Facts

arXivに「BiGym 2.0: Benchmarking Learned and Agent-Developed Policies for Humanoid Household Manipulation」が掲載された。[1]
BiGym 2.0はUnitree G1向けで、20の家庭内タスクを対象とする。[1]
各タスクに60件の人間によるVRデモンストレーションがあり、多視点カメラ映像と全身の実行記録が含まれる。[1]
比較対象はvision-language-action fine-tuning、imitation learning、demo-driven reinforcement learning、cold-start coding agentsである。[1]
環境、ヒューマンデモ、評価トレースはオープンソースとして公開された。[1]

本紙の見方

BiGym 2.0の新しさは、Unitree G1を前提にした家庭内操作の評価を、単なる模倣や単発のデモではなく、20タスク、各タスク60件のVRデモ、多視点映像、全身実行記録までそろえた比較基盤として提示した点にある。ここではロボット本体の性能そのものより、入力としての視覚・固有受容・全身制御を統一し、学習済み方策とエージェント生成プログラムを同じ条件で比べている。つまり主役は個別のアルゴリズムというより、家庭内操作を再現可能に測るための評価設計である。\n\n本紙の関連記事であるUnitree、人型ロボットを米国の『America's Got Talent』決勝舞台に登場させたと報じられるは、ロボットを公開空間で見せる文脈だったのに対し、今回のBiGym 2.0は家庭内タスクの制御と評価に軸足がある。同じUnitreeでも、前者が可視性や演出の文脈、後者が再現性と比較可能性の文脈であるため、用途の焦点は異なる。加えて、松延動力、智元機器人、宇樹科技が相次ぎ具身智能モデルを公表で示された具身智能モデルの公表と並べると、モデルの公開だけでなく、それを測る基準の整備が次の争点になっていることが見える。\n\n業界構造への含意としては、家庭内操作の競争が、単純なデモ成功率から、タスク定義、観測条件、実行記録の粒度、評価トレースの公開まで含むベンチマーク競争に移っている点が大きい。9タスク平均、両手到達、pick-box、cross-workspace stacking、multi-object transportといった個別指標が示されているため、今後はどの手法がどの条件で強いかを切り分けて比較する必要が出る。特に、デモ駆動の強化学習が難しい課題と、エージェント生成プログラムが優位な課題が分かれており、学習手法の優劣を一括で語れない構図が明確になった。\n\n未確定の論点は、BiGym 2.0が実機導入にどこまで近いかである。今回は評価基盤と公開データが示されたが、実運用で必要な失敗率、復旧手順、長時間連続稼働、家庭内の未知物体への頑健性までは書かれていない。どの条件でcross-workspace stackingやmulti-object transportを安定化できるのか、また公開されたトレースを使って他機種へ転用できるのかが次の焦点になる。

なぜ重要か

Unitree G1を対象に、20タスクと60件/タスクのVRデモをそろえた比較基盤が公開されたことで、家庭内操作の学習手法を同じ条件で検証しやすくなった。発表元のarXivによれば、環境・デモ・評価トレースも公開されており、手法の違いだけでなく評価条件の違いを見分ける材料が増えた。

日本への影響

家庭内操作の評価基盤が、全身制御・多視点映像・実行記録まで含めて公開されたことで、日本側でも研究用データの設計や再現性の確保が論点になりやすい。とくに人型ロボットの制御ソフトやシミュレーション環境を扱う研究機関・企業は、タスク定義と評価トレースの公開形式をどうそろえるかが問われる。