日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.04042v1

基盤モデルを活用したキッチンロボット操作

Kitchen Robotic Manipulation utilizing Foundation Models

シェア:XThreadsFacebookLINEはてブBluesky

家庭環境でのロボット操作のためのモジュール式認識パイプラインを提案し、皿洗いなどのキッチン作業を実ロボットで実証した。

詳しい要約

1. どんなもの?

本論文は、家庭環境、特にキッチンでの食器類の操作タスクに焦点を当てた、モジュール式の知覚パイプラインを提案している。パイプラインは、オープンボキャブラリ物体検出、マルチビューセグメンテーション、インスタンス認識3D再構成、2D-3D特徴融合戦略を統合し、6D姿勢推定と把握計画を実現する。モジュール設計により、複数の視覚・幾何学的基盤モデルを体系的に置換可能で、カスタムキッチンデータセットでの広範な評価を通じて最適な構成を特定する。最良構成(LLMDet + SAMv2 + DINOv2 + GeoTransformer)は、20シーンのキッチンベンチマークでADI 89.12%を達成し、実ロボットへの展開も確認している。

2. 先行研究と比べてどこがすごい?

従来のロボット知覚システムは、特定の環境や物体に特化した学習が必要で、動的で多様な家庭環境への適応が困難だった。本手法は、基盤モデルを組み合わせたモジュール式パイプラインにより、環境固有の再学習なしで実ロボットに展開可能な適応性とスケーラビリティを実証している。特に、オープンボキャブラリ検出と基盤モデルの融合により、事前定義されたカテゴリに依存しない汎用性を高めている点が優れている。

3. 技術・手法の肝は?

手法の肝は、モジュール式パイプラインの設計と、各モジュールの最適な組み合わせの特定にある。具体的には、オープンボキャブラリ物体検出(LLMDet)、マルチビューセグメンテーション(SAMv2)、インスタンス認識3D再構成、2D-3D特徴融合(DINOv2 + GeoTransformer)を統合し、6D姿勢推定と把握計画を行う。モジュールを交換可能にすることで、システム全体の性能を最適化する構成を体系的に探索できる。

4. どうやって有効だと検証した?

カスタムキッチンデータセット(20シーン、クラッタ・遮蔽条件)で広範な評価を実施し、最良構成がADI 89.12%を達成した。さらに、実ロボットを用いたデモ(シンクから食洗機への移載、カップ積み重ね)を環境固有の再学習なしで成功させ、適応性とスケーラビリティを検証した。

5. 議論はある?

要旨からは、議論の詳細は不明。ただし、モジュール式パイプラインの利点として、各モジュールの置換による性能比較が可能である一方、モジュール間の依存関係や統合の複雑さが課題となる可能性が示唆される。また、実環境での汎化性能や、より多様なタスクへの拡張性については、今後の検討が必要と考えられる。

6. 次に読むべき論文は?

要旨で参照されている基盤モデル(LLMDet、SAMv2、DINOv2、GeoTransformer)に関する論文や、オープンボキャブラリ物体検出、6D姿勢推定、把握計画の関連研究が挙げられる。具体的には、各基盤モデルの原著論文や、ロボット操作における基盤モデル活用のサーベイ論文が有用である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

分類: cs.RO

原文アブストラクト

Deploying robots in everyday human environments requires perception systems that are both robust and adaptable to diverse, dynamic conditions. In this work, we present a modular perception pipeline for household manipulation tasks, with a focus on dishware handling in kitchen environments. The pipeline integrates open-vocabulary object detection, multi-view segmentation, instance-aware 3D reconstruction, and a 2D-3D feature fusion strategy for 6D pose estimation and grasp planning. Its modular design enables systematic substitution of multiple visual and geometric foundation models, allowing us to identify the best-performing configuration through extensive evaluation on a custom kitchen dataset. The best-performing configuration (LLMDet + SAMv2 + DINOv2 + GeoTransformer) achieves an ADI of 89.12\% on the 20-scene kitchen benchmark with cluttered and occluded conditions. Furthermore, real-world demonstrations confirm that the best configuration can be deployed on physical robots without environment-specific retraining, successfully executing tasks such as sink-to-dishwasher transfer and cup stacking. It validates the adaptability and scalability of the pipeline and highlights its potential as a practical framework for household robotic systems. Our code and supplementary materials are available at https://raivlab.github.io/FM_kitchen .