何が起きたか
2026年7月28日、arXivに「πR²: Reactive Real-time Flow Policies」と題する論文が公開された。πR²は、大規模な事前学習済みバックボーンに基づくアクションチャンキング型フローポリシーを、リアルタイムで反応可能にする手法である。実機のxArm6+XHandプラットフォーム上でGR00T-N1.7に適用し、約25Hz(A5000 GPU上)で閉ループ再計画を実現、成功率をシミュレーションで最大23%、実世界で最大30%向上させたと報告している。
詳細
πR²は、拡散強制の位置別ノイズスケジュールに基づき、2つのアイデアを導入する。1つ目は、条件付けを高速チャネル(毎ティック更新される固有受容感覚)と非同期更新の低速チャネル(視覚言語特徴)に分割し、チャンク内で固有受容感覚に反応しつつ、古い視覚情報を許容する点。2つ目は、レイテンシ適応型フロースケジュールで、実行中のアクションをインペインティング条件として扱い、呼び出しごとに1回のデノイジングステップでアクションを出力し、1つの学習済みモデルで様々なハードウェアレイテンシに適応する点。既存アーキテクチャへの変更は最小限で、事前学習済みポリシーからファインチューニング可能としている。
Key Facts
| πR²は、アクションチャンキング型フローポリシーをリアルタイムかつ反応的にする手法であり、拡散強制の位置別ノイズスケジュールに基づく。 | [1] |
| πR²は、条件付けを高速チャネル(固有受容感覚)と非同期更新の低速チャネル(視覚言語特徴)に分割する。 | [1] |
| πR²は、レイテンシ適応型フロースケジュールにより、実行中のアクションをインペインティング条件として扱い、1回のデノイジングステップでアクションを出力する。 | [1] |
| GR00T-N1.7を実機のxArm6+XHandプラットフォームに適用した結果、閉ループ再計画はベースポリシーより約4倍高速で、約25Hz(A5000 GPU上)を達成し、40msごとに新しい観測に基づいて動作する。 | [1] |
| シミュレーションと実世界の操作タスクにおいて、πR²は最強のベースラインと比較して成功率をシミュレーションで最大23%、実世界で最大30%向上させた。 | [1] |
本紙の見方
今回の発表は、汎用操作ポリシーの実用化に向けた一歩として位置づけられる。従来のアクションチャンキング型フローポリシーは、チャンク全体を開ループで実行するため、実行中の感覚入力に反応できず、動的な環境での制御に適さないという課題があった。πR²は、この課題を「高速チャネルと低速チャネルの分割」と「レイテンシ適応型フロースケジュール」という2つの工夫で解決し、大規模バックボーンを維持したままリアルタイム性を実現した点が新しい。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、ロボット操作における基盤モデルの進展という文脈では、GR00T-N1.7のような大規模モデルを実機で活用する際の計算コストと反応性のトレードオフは共通の課題であり、πR²はその解決策の一つを示すものと言える。 業界構造への含意としては、πR²が「既存アーキテクチャへの変更が最小限」で「事前学習済みポリシーからファインチューニング可能」としている点が重要だ。これは、ロボットメーカーや研究機関が、自社のポリシーを大幅に作り直すことなく、リアルタイム性を向上させられる可能性を示唆する。特に、ハードウェアのレイテンシに適応する設計は、異なるロボットプラットフォームへの移植を容易にし、サプライチェーン全体での標準化を促進する可能性がある。 未確定の論点としては、まず、πR²の性能が報告されたタスク以外でも発揮されるかどうかが挙げられる。論文ではシミュレーションと実世界での成功率向上が報告されているが、対象タスクの範囲や複雑さは限定的かもしれない。また、約25Hzという再計画周波数はA5000 GPU上での数値であり、より低性能なハードウェアや、より大規模なモデルでの挙動は不明である。さらに、πR²が「1回のデノイジングステップ」でアクションを出力する点は、生成品質とのトレードオフがある可能性があり、その影響を検証する必要がある。
なぜ重要か
πR²は、大規模な基盤モデルを搭載したロボットが、動的な環境で実用的な速度で動作するための方法論を示した。これは、倉庫や家庭など、予測不能な状況でのロボット活用を後押しする可能性がある。また、既存モデルへの適用が容易であることから、ロボット操作の研究開発のスピードを加速させる可能性がある。