何が起きたか
arXivに2026-09-21付で掲載された論文で、GPT-6 AstraをRoboDojoの全42課題、2,100試行で評価した結果が示された。Astraは平均成功率22.48%、28.97 Scoreを記録し、公開された40の政策を上回ったとしている。比較対象では、GPT-5.5が0.88%、DeepSeek-Flashが1.92%の平均成功率だった。
詳細
論文は、Embodied AIの制御をSystem 1とSystem 2に分ける従来整理に対し、タスク特化の微調整なしにLLMをロボット操作の政策として用いる設定を扱っている。AstraとGPT-5.5は公式の「1タスク当たり50エピソード」プロトコルを使い、DeepSeek-Flashは1タスク当たり10エピソードで評価された。 結果として、Astraは意味理解を要する課題では一般化しやすい一方、精密制御、動的制御、複雑な両手協調を要する課題では弱いとされた。1回のデモンストレーションを与えるin-context実験では全体としての改善は見られず、選択された対話履歴では摂動に対するエピソード内修正が確認された。
Key Facts
| GPT-6 AstraはRoboDojoの42課題で平均成功率22.48%、28.97 Scoreを記録した。 | [1] |
| 評価は2,100試行で行われた。 | [1] |
| AstraとGPT-5.5は公式の50エピソード/課題プロトコル、DeepSeek-Flashは10エピソード/課題で評価された。 | [1] |
| GPT-5.5の平均成功率は0.88%、DeepSeek-Flashは1.92%だった。 | [1] |
| 論文は、Astraが意味理解を要する課題に強い一方、精密制御・動的制御・複雑な両手協調に弱いとしている。 | [1] |
本紙の見方
今回の論文で新しいのは、ロボット操作を支える政策としてLLMをそのまま評価し、GPT-6 Astraが公開政策群を上回ったと示した点である。ただし、主張は「一般目的の操作モデル」の可能性を示す初期証拠にとどまり、精密制御や動的制御での制約も同時に明示されている。つまり、性能の上振れと限界を同じ実験枠で並べており、楽観だけを強める内容ではない。 本紙の見方では、この論文の主軸は「ロボットに何をさせるか」より「どの層の制御をLLMに委ねられるか」にある。System 1としての高頻度行動生成と、System 2としての高レベル計画を分ける従来整理に対し、今回はタスク特化微調整なしのLLMを政策として直接置く設定を試している。これは既定路線の延長でもあるが、RoboDojoの42課題と2,100試行で比較したことで、議論が概念論から測定可能な性能評価に移った点が重要だとみられる。 本紙の関連記事はないため過去報道との連続性は置かないが、今回の結果だけでも業界への含意はある。意味理解に寄る課題で強く、精密制御や複雑な両手協調で弱いという差は、ロボット導入でLLMがすぐ全面代替するのではなく、計画層・自然言語理解・例外処理を担い、運動制御は別系統に残す構成が現実的であることを示す。一方で、in-context実験で単純な1回デモの上積みが出なかった点は、データの与え方だけでは埋まらない制御面の壁が残ることを示唆する。次に確認すべきなのは、どのタスク類型で成功率が分かれたのか、摂動への修正が再現的か、そしてタスク特化の学習や追加の制御層でどこまで改善するかである。
なぜ重要か
論文が示した22.48%という平均成功率は、LLMをロボット操作の政策として使う試みが、少なくともRoboDojoの一部課題では公開政策を上回り得ることを示す。いっぽうで精密制御や両手協調には弱さが残るため、ロボット導入側にとっては、言語理解や高レベル計画をどこまで任せ、どこから別の制御方式を残すかが具体的な設計論になる。
日本への影響
日本のロボット企業や研究機関にとっては、言語理解を要する上位制御と、精密な実機制御を分けて設計する必要性が明確になる。とくに、両手協調や高精度な操作を重視する用途では、LLM単独ではなく別系統の制御・安全機構を組み合わせる前提が重要になるとみられる。