日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.19613

TacSushi: 触覚に基づく世界行動モデリングによる器用な寿司操作

TacSushi: Tactile-Grounded World-Action Modeling for Dexterous Sushi Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

触覚と将来予測を組み込んだ世界行動ポリシーを実ロボット340成功・50失敗試行で学習し、寿司の変形・遮蔽・不確実な接触下での操作を実現した。

詳しい要約

1. どんなもの?

- 寿司の把持・加工など変形・遮蔽・接触不確実性を伴うdexterous food manipulationのためのtactile-grounded world-action policy。 - Cosmos3をbackboneとし、現在のRGB・language・hand stateを符号化。 - fingertip tactileをfeature-wise gated fusionでaction表現に統合。 - 訓練時のみfuture visual observations・task progress・relative contact risk・tactile summariesを予測するdecoderを使用し、deployment時は除去。 - 成功340・失敗50の実機trialで学習。

2. 先行研究と比べてどこがすごい?

- future-consequence supervisionなし(36.7%/10.0%)やtactileの直接concatenation(25.0%/17.5%)と比較し、Full TacSushiはin-distribution 68.3%、out-of-distribution 37.5%を達成。 - feature-wise gated tactile fusionとtraining-only predictive supervisionの相補的効果を示す。 - 失敗trialのconsequence supervisionを活用しつつ、そのactionはimitationから除外する点が特徴。

3. 技術・手法の肝は?

- Cosmos3ベースのworld-action policy。 - backboneがcurrent RGB・language・hand stateを符号化。 - feature-wise gated fusionでfingertip tactile featuresをaction representationへ統合。 - 訓練時、demonstrated action chunksに条件付けられたdecoderがlogged future visual observations・task progress・relative contact risk・tactile summariesを予測。 - deployment時はdecoderを削除。 - 失敗trialはconsequence supervisionにのみ使用し、actionはimitationから除外。

4. どうやって有効だと検証した?

- 340成功・50失敗のreal-robot trialsで学習。 - 3つのin-distributionタスクと2つのout-of-distribution ingredient variantsにわたり、600 rolloutsで6手法を比較。 - 終端成果をanchored visual-quality protocolで評価。5つのhuman ratingsと3つのvision-language-model ratingsを等重みでスコア化。 - Full TacSushiはin-distribution 68.3%、out-of-distribution 37.5%の平均成功率。

5. 議論はある?

- feature-wise gated tactile fusionとtraining-only predictive supervisionの相補的利点が比較結果から支持される。 - 失敗trialのactionをimitationから除外しつつconsequence supervisionに用いる設計の有効性が示唆される。 - 限界や今後の課題についての具体的な議論は要旨からは不明。

6. 次に読むべき論文は?

- Cosmos3 - feature-wise gated fusion - tactile-grounded world-action modeling - dexterous food manipulation - anchored visual-quality protocol - vision-language-model ratings

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haodi Hu, Kaen Kogashi, Toshiaki Koike-Akino

分類: cs.RO, cs.AI, cs.LG

原文アブストラクト

Dexterous food manipulation requires control under deformation, occlusion, and uncertain contact. We present TacSushi, a tactile-grounded, Cosmos3-based world-action policy that learns from recorded future consequences while acting on current observations. The backbone encodes current RGB, language, and hand state, and feature-wise gated fusion incorporates fingertip tactile features into the action representation. During training, a decoder conditioned on demonstrated action chunks predicts logged future visual observations, task progress, relative contact risk, and tactile summaries; this decoder is removed at deployment. Failed trials provide consequence supervision, but their actions are excluded from imitation. We train TacSushi on 340 successful and 50 failed real-robot trials and compare six methods in 600 separate rollouts across three in-distribution tasks and two out-of-distribution ingredient variants. To assess food quality beyond a single geometric threshold, we score terminal outcomes using an anchored visual-quality protocol that equally weights five human ratings and three vision-language-model ratings per rollout. Full TacSushi achieves 68.3% average in-distribution success and 37.5% out-of-distribution success, compared with 36.7%/10.0% without future-consequence supervision and 25.0%/17.5% with direct tactile concatenation in place of gated fusion. These comparisons support complementary benefits of feature-wise gated tactile fusion and training-only predictive supervision.

関連論文

PR本紙発行元 EmplifAI