何が起きたか
研究チームは2025年11月7日、arXivにプレプリント「TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models」を公開した。TwinVLAは、事前学習済みの単腕VLAを2つ組み合わせて両腕操作を行うモジュラーフレームワークで、両腕データの事前学習なしで、実世界とシミュレーションの多様な両腕タスクにおいて、同等サイズのモノリシックモデルRDT-1Bを上回る性能を達成したと報告している。
詳細
TwinVLAは、事前学習済みの単腕VLAを2つ組み合わせて、協調的な両腕VLAを構成する。モノリシックなクロスエンボディモデル(単腕と両腕の混合データで学習)と比較して、データ効率と性能の両方を改善するという。実験では、実世界とシミュレーションの多様な両腕タスクで、同等サイズのモノリシックモデルRDT-1Bを上回り、大規模な専有両腕データと計算コストに依存する最先端モデルπ0との差を縮めたとしている。
Key Facts
| TwinVLAは、事前学習済みの単腕VLAを2つ組み合わせて両腕操作を行うモジュラーフレームワークである。 | [1] |
| TwinVLAは、両腕データの事前学習を必要とせず、公開の単腕データのみで、同等サイズのモノリシックモデルRDT-1Bを上回る性能を達成した。 | [1] |
| TwinVLAは、大規模な専有両腕データと計算コストを要する最先端モデルπ0との差を縮めた。 | [1] |
| 研究チームは、このモジュール構成アプローチが、公開の単腕データを活用した高性能な両腕操作へのデータ効率的でスケーラブルな道を確立するとしている。 | [1] |
なぜ重要か
TwinVLAの提案は、両腕操作ロボットの学習におけるデータ効率の課題に対する実用的な解決策を示すものであり、公開データのみで高性能を実現できる可能性を秘めている。これにより、データ収集コストの高い両腕操作の実用化が加速し、ロボットの産業応用範囲が広がることが期待される。