日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.13606

視覚から収穫へ:マルチアームロボット果実収穫のための視覚言語モデルベンチマーク

From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting

シェア:XThreadsFacebookLINEはてブBluesky

実世界の果樹園画像を用いて、事前学習済み視覚言語モデルがゼロショットでマルチアーム収穫計画を生成できるかを評価する初のベンチマークを提案し、従来手法と比較した。

詳しい要約

1. どんなもの?

- マルチアームロボットによる果実収穫の計画に、事前学習済みVision-Language Models (VLMs) をゼロショットで適用する初の包括的ベンチマークを提案。 - 実世界のリンゴと柑橘類の果樹園画像を使用。 - VLMベースの計画パイプラインと従来のperception-and-planningパイプラインを比較。 - VLMパイプラインは各アームの収穫シーケンスとwaypointsを直接生成し、軽量なtrajectory verifierが衝突をチェック。

2. 先行研究と比べてどこがすごい?

- 既存手法は対象環境での大量データ収集を必要とするか、計画品質を制限する単純化仮定に依存。 - 本研究は、事前学習済みVLMsをゼロショットでマルチアーム果実収穫計画に評価する初のベンチマークを提供。 - 実世界の果樹園画像を用い、VLMパイプラインと従来パイプラインを比較する点が新しい。

3. 技術・手法の肝は?

- VLMパイプラインが各アームの収穫シーケンスとwaypointsを直接生成。 - 軽量なtrajectory verifierが衝突をチェック。 - 従来のperception-and-planningパイプラインと比較。 - 実世界のリンゴと柑橘類の果樹園画像を使用。

4. どうやって有効だと検証した?

- 実世界のリンゴと柑橘類の果樹園画像を用いたベンチマークで評価。 - VLMベースの計画パイプラインと従来のperception-and-planningパイプラインを比較。 - 最先端VLMsがゼロショットで効果的なマルチアーム収穫計画を生成できることを示した。

5. 議論はある?

- 最先端VLMsはゼロショットで効果的なマルチアーム収穫計画を生成可能。 - しかし、実用的な展開は正確な3D waypoint生成と衝突を考慮した協調によって制限される。 - これらの結果は、マルチアームロボット収穫における事前学習済みVLMsの可能性と現在の限界の両方を強調。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、従来のperception-and-planningパイプライン、trajectory verifier、マルチアームロボット収穫、Vision-Language Models (VLMs) が挙げられる。 - 同分野の定番として、マルチアームロボット収穫に関する研究やVLMsのロボティクス応用論文を読むべき。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Vrishan Inukollu, Adyan Zaman, Anvi Kudaraya, Carlos Lazcano, Yuankai Zhu, Stavros Vougioukas, Xiaofan Yu

分類: cs.RO, cs.CV

原文アブストラクト

Multi-arm robotic harvesting offers a promising path to improve harvesting efficiency and reduce reliance on manual labor. However, practical deployment remains challenging because the system must generalize across diverse environments while efficiently coordinating multiple arms in a shared workspace. Existing methods often require substantial data collection in target environments or rely on simplifying assumptions that limit planning quality. In this work, we introduce the first comprehensive benchmark for evaluating pretrained Vision-Language Models (VLMs) on zero-shot multi-arm fruit harvesting planning. Our benchmark uses real-world apple and citrus orchard images and compares a VLM-based planning pipeline with a traditional perception-and-planning pipeline. The VLM pipeline directly generates harvesting sequences and waypoints for each arm, while a lightweight trajectory verifier checks for collisions. Our results show that frontier VLMs can generate effective multi-arm harvesting plans zero-shot, but a practical deployment remains limited by accurate 3D waypoint generation and collision-aware coordination. These results highlight both the promise and current limitations of pretrained VLMs for multi-arm robotic harvesting.

関連論文