何が起きたか

arxiv.orgに2026-09-24付で掲載された論文「HarnessPAI: An Evolving Harness for Physical AI」は、Physical AI向けのハーネス枠組み「HarnessPAI」を提案した。コードを、低レベル制御を束ねる実行可能かつ進化可能なインタフェースとして扱う設計である。論文は、再学習なしで既存の行動モデルやcode-as-policy系ベースラインを上回ったとしている。 評価対象は、デスクトップのロボットアーム、家庭用ロボット、ロボット掃除機、脚式歩行エージェントである。論文によると、LIBERO-PROでは$π_{0.5}$に対して61.6ポイント、RoboCasaのatomic tasksではWorldDreamerに対して27.2ポイントの改善を示した。

詳細

HarnessPAIは、1回の実行中はプログラムレベルでオープンループに動かし、固定されたプログラムが実行を案内・検査する。一方、複数回の実行をまたぐ段階ではクローズドループで進化し、実行フィードバックを用いてプログラムを修正し、失敗を再利用可能なスキルに蒸留するとしている。 論文は、プログラムが選ばれた後の実行ではオンラインの高レベルLLM推論を要しないとも述べる。また、収束したプログラムは安価で信頼できる専門家データ収集器として機能し、そのデータで$π_{0.5}$をファインチューニングすると、LIBERO-PROの成功率が38.8ポイント上がったとしている。

Key Facts

arxiv.orgに「HarnessPAI: An Evolving Harness for Physical AI」が掲載された。[1]
論文はHarnessPAIを、Physical AI向けのモデル・具現化非依存のハーネス枠組みと位置づけた。[1]
評価対象はデスクトップのロボットアーム、家庭用ロボット、ロボット掃除機、脚式歩行エージェントである。[1]
LIBERO-PROでは$π_{0.5}$に対して61.6ポイントの改善を示したと論文は述べる。[1]
RoboCasaのatomic tasksではWorldDreamerに対して27.2ポイントの改善を示したと論文は述べる。[1]

本紙の見方

今回の主題は、単体の行動モデルを強くする話ではなく、実行のたびに検証し、複数回の実行を通じて手続きを更新する「ハーネス」を前面に出した点にある。論文は、ロボットアーム、家庭用ロボット、ロボット掃除機、脚式歩行エージェントという異なる具現化で同じ枠組みを使い、再学習なしでベースラインを上回ったとしており、焦点はモデル差ではなく実行系の設計に移っている。 本紙の見方では、この構図は「知覚・推論・行動」を一体で扱う方向への一歩だが、あくまで論文内の評価に基づく主張である。過去の本紙関連記事はないため、連続報道としての差分は置けないが、少なくともこの論文は、低レベル制御を直接出す方式より、コードを中間表現にして実行と修正を回す方式を優先している。ここから読み取れるのは、Physical AIで重要なのが出力精度だけでなく、失敗をどう蓄積し再利用可能な技能へ変えるかだという点である。 業界構造への含意は、モデル性能の競争軸が「どの大規模モデルを使うか」から「どういうハーネスで安全に実行し、フィードバックを集めるか」に広がることだ。論文は、収束したプログラムが専門家データ収集器になるとしており、実行基盤がそのままデータ生成基盤に転じる構造を示している。ただし、ここで示されたのは研究上の性能であって、実機運用の稼働率、失敗時の安全設計、長時間タスクでの安定性、どの程度の追加データで再現できるかはまだ確認が必要である。

なぜ重要か

論文の主張が正しければ、Physical AIの改善余地は行動モデル単体だけでなく、実行・検査・修正の仕組みにもあることになる。特に、再学習なしで複数のロボット形態にまたがって性能を示した点は、実機ごとにモデルを作り込み直す負担を下げる可能性がある。 また、収束したプログラムを専門家データ収集に使い、そのデータで再学習すると成功率が38.8ポイント上がったとしており、実行基盤と学習基盤が循環する設計が示された。