何が起きたか

2025年6月9日付でarXivに公開された論文(識別番号2506.07339v2)が、アクション・チャンキングポリシーのリアルタイム実行を可能にする推論時アルゴリズム「RTC(Real-Time Chunking)」を発表した。同アルゴリズムは、拡散またはフローベースのVLA(視覚言語行動モデル)に再学習なしで適用可能とされる。論文では、Kinetixシミュレータで12の高ダイナミックタスク、実世界では6の両腕操作タスクを評価し、推論遅延に対して頑健で、マッチ点火などの精密タスクでも高成功率を達成したと報告している。

詳細

論文は、現代のAIシステム、特に物理世界と相互作用するシステムではリアルタイム性能がますます重要になっているが、最新の汎用モデル(VLAを含む)の高レイテンシが課題だと指摘する。アクション・チャンキングは高周波制御タスクで時間的一貫性を可能にするが、レイテンシ問題を完全には解決せず、チャンク境界でポーズや分布外のぎくしゃくした動きを引き起こすと説明する。 提案手法RTCは、現在のチャンクを実行しながら次のアクションチャンクを生成し、実行が保証されたアクションを「凍結」し、残りを「インペイント」する。これにより、推論遅延があってもスムーズな非同期実行を実現する。論文は、RTCが高速で高性能、かつ推論遅延に対して独自に頑健であり、タスクスループットを大幅に向上させ、マッチ点火のような精密タスクでも高い成功率を可能にするとしている。動画はプロジェクトページ(https://pi.website/research/real_time_chunking)で公開されている。

Key Facts

論文は2025年6月9日付でarXivに公開された(識別番号2506.07339v2)。[1]
提案アルゴリズムは「RTC(Real-Time Chunking)」と呼ばれる。[1]
RTCは拡散またはフローベースのVLAに再学習なしで適用可能とされる。[1]
RTCは現在のチャンク実行中に次のチャンクを生成し、実行確定アクションを「凍結」、残りを「インペイント」する。[1]
評価にはKinetixシミュレータの12の高ダイナミックタスクを使用した。[1]
実世界では6の両腕操作タスクを評価した。[1]
RTCは推論遅延に対して頑健で、マッチ点火などの精密タスクで高成功率を達成したと報告されている。[1]
動画はhttps://pi.website/research/real_time_chunkingで公開されている。[1]

なぜ重要か

本手法は、物理世界と相互作用するAIシステムのリアルタイム性能向上に寄与する可能性がある。再学習不要で既存のVLAに適用できるため、実用化への障壁が低く、ロボット制御などの分野での応用が期待される。