何が起きたか
2026年夏、スタンフォード大学のフェイフェイ・リー教授、NVIDIAのEmbodied AI責任者ジム・ファン、ジョージア工科大学助教授のダンフェイ・シューらが率いる研究チームは、産業用AIモデル「π0.5」に触覚データを追加する実験で、タスク成功率が17%から6%に低下するという結果に直面した。この結果を受け、チームは視覚と触覚を単一のニューラルネットワークに統合する従来のアプローチが構造的に欠陥があると結論づけ、分散処理フレームワーク「T-Rex」を導入した。
詳細
研究チームは、視覚と触覚のタイミング不一致が失敗の根本原因だと特定した。視覚は約5フレーム/秒で環境をスキャンする低速のマクロ変数である一方、触覚はロボット指が表面に接触した瞬間に摩擦、圧力、素材変形が瞬時に変化する高周波の動的変数であり、20Hz以上の周波数で処理する必要がある。これらを単一モデルに統合すると、触覚の高速解像度がカメラの低速処理に抑制され、触覚フィードバックが学習済みの視覚表現を乱すため、性能が低下する。 この問題を解決するため、チームは制御アーキテクチャを全面的に書き換え、「T-Rex」(Tactile-Reactive Dexterous Manipulation)を開発した。T-Rexは「Mixture-of-Transformers(MoT)」アーキテクチャを採用し、3つの専門モジュールに制御を分割する。Latent Expertは長期的なプランナーとして視覚と言語フィードを監視し、Action Expertは約5Hzで動作するマクロ経路計画を担当し、Tactile Expertは接触発生時に20Hz以上の超高速で指先の圧力と形状データを読み取り、ミリ秒単位の補正を適用する。 触覚信号を理解するため、チームはVQ-VAEモジュールに基づくデータ変換器を構築し、生の圧力データを離散的な「タッチワード」に圧縮した。また、100時間の連続テストからなる同期触覚データセットを構築し、200以上の消費者製品と22の基本動作(把持、圧迫、挿入、拭き取りなど)を7,700以上の軌跡でカバーした。訓練は、約23,000時間の人間のビデオでの事前学習、100時間のロボット触覚データセットでの調整、少数のタスクデモでの微調整という多段階アプローチを採用している。
Key Facts
| 研究チームはスタンフォード大学のフェイフェイ・リー教授、NVIDIAのEmbodied AIリーダーであるジム・ファン、ジョージア工科大学助教授のダンフェイ・シューらで構成される。 | [0] |
| 産業用AIモデル「π0.5」に触覚データを追加した実験で、タスク成功率が17%から6%に低下した。 | [0] |
| 視覚は約5フレーム/秒で環境をスキャンするのに対し、触覚は20Hz以上の周波数で処理する必要がある。 | [0] |
| 研究チームは分散処理フレームワーク「T-Rex」(Tactile-Reactive Dexterous Manipulation)を開発した。 | [0] |
| T-Rexは「Mixture-of-Transformers(MoT)」アーキテクチャを採用し、Latent Expert、Action Expert、Tactile Expertの3つの専門モジュールで構成される。 | [0] |
| Action Expertは約5Hzで動作し、Tactile Expertは接触時に20Hz以上の超高速で指先データを処理する。 | [0] |
| チームはVQ-VAEモジュールに基づくデータ変換器を構築し、圧力データを離散的な「タッチワード」に圧縮した。 | [0] |
| 同期触覚データセットは100時間の連続テストで構成され、200以上の消費者製品と22の基本動作を7,700以上の軌跡でカバーする。 | [0] |
| 訓練は約23,000時間の人間のビデオでの事前学習、100時間のロボット触覚データセットでの調整、少数のタスクデモでの微調整という多段階アプローチを採用している。 | [0] |
なぜ重要か
この研究は、視覚・言語・触覚などすべての感覚入力を単一の大規模ニューラルネットワークに統合するという業界の主流アプローチに疑問を投げかけ、感覚ごとに独立した処理経路を持つアーキテクチャの有効性を実証した。触覚と視覚の時間スケールの不一致がロボット性能を著しく低下させることを示し、今後のロボットAI設計に重要な指針を与える。