日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
触覚arXiv:2610.08068

PhysTacGen: 物理を考慮した視覚触覚センサ画像生成

PhysTacGen: Physics-Aware Visual-Tactile Sensor Image Generation

シェア:XThreadsFacebookLINEはてブBluesky

視覚画像から触覚画像を生成するフレームワークPhysTacGenを提案し、材料記述と幾何条件を統合して高品質な触覚画像を合成する。

詳しい要約

1. どんなもの?

- 視覚画像から光学式触覚画像を生成するフレームワークPhysTacGenを提案。 - 材料認識記述と幾何条件を統合し、視覚-触覚データの不足を補う。 - 具体的には、GTPOによる材料記述生成、DINOv2と単眼相対深度によるペア選定、SDXL ControlNetによる触覚画像合成からなる。

2. 先行研究と比べてどこがすごい?

- 従来の視覚-触覚合成は視覚的外観と接触材料特性のギャップ、空間的ミスアライメントが課題。 - PhysTacGenは材料認識記述と幾何条件を組み合わせ、これらの課題に対処。 - 比較ベースラインよりも構造類似性が向上し、ユーザ研究でGTPO生成記述が好まれるなど優位性を示す。

3. 技術・手法の肝は?

- Group Tactile Policy Optimization (GTPO): 強化学習で視覚言語モデルを微調整し、タスク特異的報酬で構造化材料記述を生成。 - DINOv2ベースのペアキュレーションと単眼相対深度推定で訓練ペアを選定し幾何事前を提供。 - SDXL ControlNetがRGB、相対深度、GTPO生成テキストを条件に光学触覚画像を合成。

4. どうやって有効だと検証した?

- キュレーションされたSSVTPデータで実験。 - 構造類似性が比較ベースラインより改善。 - 盲検ユーザ研究でGTPO生成記述が好まれる。 - 生成触覚入力を用いた属性由来力係数予測プロキシの性能向上を確認。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究: SSVTPデータ、DINOv2、SDXL ControlNet、GTPO。 - 関連手法: 視覚-触覚合成、光学式触覚センサ、強化学習による視覚言語モデル微調整。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Guo Tang, Yongtao Wang

分類: cs.CV

原文アブストラクト

Realistic physical interaction is a cornerstone of embodied intelligence, yet collecting paired visual--tactile data remains costly. Visual-to-tactile synthesis offers a promising approach to augmenting such data, but learning this mapping is complicated by the gap between visual appearance and contact-related material properties, as well as spatial misalignment in paired observations. To address these challenges, we present \textbf{PhysTacGen}, a visual-to-optical-tactile image generation framework that integrates material-aware descriptions with geometric conditioning. First, we introduce Group Tactile Policy Optimization (GTPO), a reinforcement learning strategy that refines a vision--language model to generate structured material descriptions using task-specific rewards. Second, we combine DINOv2-based pair curation with monocular relative-depth estimation to select training pairs and provide geometric priors. Finally, an SDXL ControlNet synthesizes optical tactile images conditioned on RGB, relative depth, and GTPO-generated text. Experiments on curated SSVTP data demonstrate improved structural similarity over the compared baselines, while a blinded user study shows a preference for GTPO-generated descriptions. Generated tactile inputs also improve performance on an attribute-derived force-coefficient prediction proxy. Together, these results demonstrate the effectiveness of PhysTacGen for optical tactile image synthesis and its utility in the evaluated downstream task.The code will be available at https://github.com/VDIGPKU/PhysTacGen.

関連論文

PR本紙発行元 EmplifAI