何が起きたか
TacSushiは2026年9月17日、寿司の巧緻操作向けに、触覚を基盤にしたCosmos3ベースのworld-action policyを発表した。学習では、現在のRGB、言語、手の状態に加え、指先触覚を特徴融合で行動表現に取り込んだ。実機データは成功340件と失敗50件で、3つの分布内タスクと2つの分布外食材変種に対して計600回のロールアウトで6手法を比較した。
詳細
訓練時には、実演された行動チャンクを条件にしたデコーダーが、記録された将来の視覚観測、タスク進捗、相対接触リスク、触覚要約を予測する仕組みを採った。このデコーダーは導入時には取り除かれる。失敗試行は結果監督には使うが、その行動は模倣学習から除外した。 成果評価では、単一の幾何学的しきい値ではなく、端末結果を5件の人間評価と3件の視覚言語モデル評価で等重みづけする anchored visual-quality protocol を用いた。TacSushi full は分布内で平均68.3%の成功率、分布外で37.5%の成功率を示し、将来結果の監督なしでは36.7%/10.0%、直接の触覚連結では25.0%/17.5%だった。
Key Facts
| TacSushiは、触覚を基盤にしたCosmos3ベースのworld-action policyである。 | [1] |
| 学習データは成功340件、失敗50件の実機試行である。 | [1] |
| 比較は3つの分布内タスクと2つの分布外食材変種で計600回のロールアウトにより行われた。 | [1] |
| 訓練時デコーダーは、将来の視覚観測、タスク進捗、相対接触リスク、触覚要約を予測するが、導入時には除去される。 | [1] |
| TacSushi full は分布内68.3%、分布外37.5%の平均成功率を示した。 | [1] |
本紙の見方
TacSushiの新しさは、寿司という変形しやすく接触が不確実な対象に対し、触覚を単なる補助入力ではなく行動表現へゲート付きで統合し、さらに学習時のみ将来結果の予測監督を加えた点にある。一方で、推論時にはその予測デコーダーを外す設計であり、実運用では現在観測に基づく制御へ整理している。つまり、学習段階で将来の失敗や接触リスクを学び、実行段階では軽い構成に戻す二層構造である。 本紙の見方では、ここで重要なのは「触覚を足した」ことそのものではなく、直接連結した場合の25.0%/17.5%に対して、特徴単位のゲート融合では68.3%/37.5%まで改善している点である。単純な入力追加ではなく、どの特徴をどの程度通すかを制御する設計が、食材の変形と接触不確実性に効いた可能性がある。さらに、失敗試行を結果監督にのみ使い、模倣対象からは外しているため、失敗を「正解行動」として学ばせない学習設計も特徴である。これは、食品操作のように失敗のコストが高い領域で、データの扱い方そのものが性能を左右することを示す。 一方で、600回のロールアウト、3つの分布内タスク、2つの分布外変種という評価枠は限定的であり、どの程度一般化するかはなお確認が必要である。とくに、食材の種類が増えたときの頑健性、触覚センサーの配置や分解能への依存、実機での速度・スループットとの両立は本文だけでは読めない。今後は、寿司以外の食品、長時間運用、失敗試行の比率が変わった場合の挙動を確認する必要があるとみられる。
なぜ重要か
寿司のような軟体・変形対象では、RGBだけでなく触覚と接触リスクの扱いが制御成否を左右すると示した点に意味がある。発表によれば、TacSushi full は将来結果の監督なしの構成より分布内で大きく高い成功率を示しており、学習時の予測監督と特徴融合の設計が実機操作に影響しうることを示唆する。
日本への影響
寿司は日本の食文化に深く結びつく対象であり、食品操作での触覚統合と失敗試行の使い方は、日本のロボット研究や食品製造設備に近い論点を含むとみられる。特に、変形食材の把持・接触を扱う実機データの設計は、日本の食品加工向けロボティクスで焦点になりうる。