何が起きたか

ICRA 2026のワークショップで開催されたGOOSE 2D Fine-Grained Semantic Segmentation Challengeにおいて、DINOv3を活用した手法が最終フェーズのリーダーボードで首位を獲得した。公式複合スコアは76.57%で、内訳は細分類mIoU 69.32%、カテゴリmIoU 83.81%である。

詳細

このチャレンジは、オフロード画像の高密度セマンティックセグメンテーションを評価するもので、64クラスの細分類と11の非ボイド粗カテゴリで構成される。提案手法は、自己教師ありのDINOv3 ViT-L/16バックボーン、ViT-Adapter、Mask2Formerマスク分類デコーダを組み合わせ、グローバル[CLS]トークンに粗カテゴリ補助損失を追加した。推論時には、マルチスケールと水平フリップのテスト時拡張、およびCodabenchスコアに基づいて選択した上位3チェックポイントのアンサンブルを採用した。

Key Facts

GOOSE 2DチャレンジでDINOv3を活用した手法が首位を獲得し、公式複合スコアは76.57%(細分類mIoU 69.32%、カテゴリmIoU 83.81%)だった。[2]
チャレンジは64クラスの細分類と11の非ボイド粗カテゴリで構成される。[2]
提案手法はDINOv3 ViT-L/16バックボーン、ViT-Adapter、Mask2Formerデコーダを組み合わせ、粗カテゴリ補助損失を追加した。[2]
推論時にはマルチスケールと水平フリップのテスト時拡張、および上位3チェックポイントのアンサンブルを採用した。[2]
別の提出では、SegFormerベースラインからMask2Formerへの移行とトレーニングクロップサイズの増加により、mIoU 69.6%を達成した。[1]

本紙の見方

今回の首位獲得は、野外ロボティクスにおける高密度セマンティックセグメンテーションの精度向上に、自己教師あり学習とクエリベースのアーキテクチャが有効であることを示している。DINOv3のような自己教師ありバックボーンは、ラベルなしデータから豊富な特徴を獲得でき、オフロード環境のような多様なシーンで頑健性を発揮する。また、Mask2Formerのマスク分類デコーダは、細かいクラス間の区別に優れており、粗カテゴリ補助損失が全体の一貫性を高めている。テスト時拡張とアンサンブルは、推論時の安定性を向上させる実用的な手法であり、競技設定では大きなアドバンテージとなる。 一方、別の提出では、SegFormerベースラインからMask2Formerへの移行とトレーニングクロップサイズの増加により、mIoU 69.6%を達成しており、クエリベースのアーキテクチャとコンテキストの重要性が再確認された。この結果は、アーキテクチャの選択とトレーニング戦略が精度に大きく影響することを示している。 業界への含意として、自己教師あり学習とクエリベースのセグメンテーションは、自動運転や農業ロボットなど、オフロード環境での認識タスクに応用可能であり、実世界のロボットシステムの性能向上に寄与する可能性がある。ただし、今回の結果は特定のデータセットとチャレンジ設定に基づくものであり、汎用性には注意が必要である。 未確定の論点としては、提案手法の計算コストや推論速度、他のデータセットでの汎化性能が挙げられる。また、コードと重みが公開される予定であるため、再現性の検証が今後の課題となる。

なぜ重要か

この成果は、野外ロボティクスにおけるセマンティックセグメンテーションの精度向上に寄与し、自己教師あり学習とクエリベースのアーキテクチャの有効性を示す。今後のロボットの環境認識技術の発展に影響を与える可能性がある。