日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
農業ロボティクス/物体検出arXiv:2608.23636

複雑な果樹園における微細小物体検出とインスタンス分割のためのYOLOv26、YOLOv11、YOLOv8の世代間最適化

Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards

シェア:XThreadsFacebookLINEはてブBluesky

果樹園環境での小物体検出とセグメンテーションの課題に対し、YOLOv8、YOLOv11、YOLOv26を比較し、小物体向けトレーニング設定が精度と効率のバランスに優れることを示した。

詳しい要約

1. どんなもの?

本研究は、複雑な果樹園環境における微細な小型物体の検出とインスタンスセグメンテーションの課題に取り組むため、Ultralytics YOLOv8、YOLOv11、YOLOv26の3世代にわたるモデルをベンチマークしたものである。対象は、リンゴの果実(fruitlet)、がく片(calyx)、花柄(peduncle)の3クラスで、ロボットによる果樹園認識を目的とする。5つのモデルスケール(n, s, m, l, x)と、従来の640x640および小型物体向けの960x960のトレーニング設定を組み合わせ、計30の実験を実施した。

2. 先行研究と比べてどこがすごい?

先行研究では、果樹園環境での小型物体検出は、緑と緑の類似性、遮蔽、微細な果実構造の画素表現の限界により困難とされてきた。本研究は、YOLOv8からYOLOv11、そして最新のYOLOv26までのクロスジェネレーション比較を体系的に行い、モデル容量の増加が必ずしも精度向上につながらないことを示した点が新しい。また、小型物体に焦点を当てた960x960のトレーニング設定が、精度と効率のトレードオフを改善することを実証した。

3. 技術・手法の肝は?

手法の肝は、YOLOv8、YOLOv11、YOLOv26の各モデルを、5つのスケール(n, s, m, l, x)で、640x640と960x960の2つの入力解像度でトレーニングし、計30の実験を系統的に比較した点にある。特に、小型物体に焦点を当てた960x960のトレーニング設定が、検出精度(box mAP@50:95)とセグメンテーション精度(mask mAP@50:95)に与える影響を評価した。また、モデルのパラメータ数とGFLOPsを報告し、精度と効率のトレードオフを分析した。

4. どうやって有効だと検証した?

有効性の検証は、果樹園環境で収集されたデータセットを用いて、30の実験を実施し、box mAP@50:95とmask mAP@50:95を指標として比較した。その結果、YOLOv11s-960が最高のmask mAP@50:95(0.402)とbox mAP@50:95(0.426)を達成し、YOLOv26s-960はそれぞれ0.397と0.425で、パラメータ数10.37M、GFLOPs 34.1と効率的であることを示した。また、花柄(peduncle)が最も困難なクラスであることを明らかにした。

5. 議論はある?

議論として、モデル容量の増加が一貫して精度を向上させるわけではないことが示され、小型物体検出にはモデルサイズよりもトレーニング設定(特に解像度)が重要である可能性が示唆される。また、YOLOv26はYOLOv11と同等の精度をより少ないパラメータで達成しており、効率性の面で優れている。しかし、花柄の検出が依然として課題であり、今後の改善が必要である。要旨からは、データセットの詳細や特定の環境条件に関する議論は不明である。

6. 次に読むべき論文は?

次に読むべき論文としては、要旨で比較されているUltralytics YOLOv8、YOLOv11、YOLOv26の各モデルの原著論文が挙げられる。また、小型物体検出の一般的な手法として、Feature Pyramid Networks (FPN)や、物体検出のベンチマークとしてMS COCO datasetに関する論文が関連する。さらに、農業ロボティクスにおける果実検出の先行研究も参考になる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ranjan Sapkota, Manoj Karkee

分類: cs.CV

原文アブストラクト

Small-object detection and instance segmentation remain challenging in orchard environments because of green-on-green similarity, occlusion, and limited pixel representation of fine fruit anatomy. This study presents a cross-generation benchmark of Ultralytics YOLOv8, YOLOv11, and YOLOv26 for detecting and segmenting apple fruitlet, calyx, and peduncle structures for robotic orchard perception. Five model scales (n, s, m, l, and x) were evaluated under conventional 640 x 640 and small-object focused 960 x 960 training configurations, yielding 30 experiments. Increasing model capacity did not consistently improve accuracy. YOLOv11s-960 achieved the highest observed mask mAP@50:95 (0.402) and box mAP@50:95 (0.426), while YOLOv26s-960 achieved comparable values of 0.397 and 0.425 with only 10.37 M parameters and 34.1 GFLOPs. Peduncle remained the most challenging class. Overall, compact-to-moderate YOLO models with small-object-focused training provided favorable accuracy efficiency trade-offs, establishing a practical benchmark for fine-grained agricultural robotics and orchard perception. Github Link: https://github.com/rnjnspkt/Optimizing-and-Comparing-Ultralytics-YOLOv26-YOLOv11-and-YOLOv8-for-Small-Object-Detection-and-Seg