日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
データセットarXiv:2608.31002v1

DARP: 多視点ロボット知覚のための校正済み双腕RGB-D-IRデータセット

DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception

シェア:XThreadsFacebookLINEはてブBluesky

自己遮蔽や表面の不完全な可視性を解決するため、双腕ロボットに搭載したRGB-D-IRセンサで多視点データを収集するデータセットを構築し、幾何学的整合性を評価した。

詳しい要約

1. どんなもの?

DARPは、2台の独立して動くeye-in-handマニピュレータを用いた、物体中心のロボット知覚のための較正済みデュアルアームRGB-D-IRデータセットである。各アームにはIntel RealSenseセンサが搭載され、RGB、深度、ステレオ赤外線データを連続記録し、同期されたロボット関節状態も記録される。10種類のテーブルトップ物体を含み、カメラ軌道を共有メトリックフレームで再構成するための較正情報、ロボット状態ログ、物体メタデータを提供する。

2. 先行研究と比べてどこがすごい?

先行研究の多くは単一視点のデータセットであり、自己遮蔽や表面の不完全な可視性に制限される。DARPは、2台のアームを反対側に配置し、自動位置特定、クロスアーム確認、適応的視点生成、連続マルチモーダル記録を備えた取得手順を導入することで、これらの制限に対処している。また、学習や生成的な補完法を用いずに、幾何学的整合性を評価するための決定論的マルチビュー融合パイプラインを提供する点が特徴的である。

3. 技術・手法の肝は?

手法の肝は、物体を固定ポーズやマーク位置なしで配置し、自動位置特定、クロスアーム確認、適応的視点生成、連続マルチモーダル記録を含む取得手順にある。各アームのセンサはRGB、深度、ステレオ赤外線を記録し、ロボット関節状態を同期ログする。較正情報とロボット状態ログにより、カメラ軌道を共有メトリックフレームで再構成できる。評価には、決定論的マルチビュー融合パイプラインを使用し、較正済みRGB-D観測を部分点群と表面メッシュに変換する。

4. どうやって有効だと検証した?

224の保持されたRGB-Dキーフレーム(1,563,466の3次元クエリポイントを含む)で評価し、点群とメッシュ間の距離の中央値が2.13 mm、RMSEが4.04 mm、ポイントの96.56%が10 mm以内にあることを示した。これにより、取得したデータの幾何学的整合性を検証している。

5. 議論はある?

要旨からは、データセットの限界や潜在的なバイアスについての議論は不明である。ただし、データセットはマルチビュー再構成、協調ロボット知覚、マルチモーダル融合、能動的知覚、将来の学習ベースの推論のための再利用可能なリソースとして意図されている。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、マルチビュー再構成やロボット知覚のためのデータセット(例:YCB-Video dataset)や、能動的知覚に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz

分類: cs.RO, cs.CV

原文アブストラクト

Robotic perception from a single viewpoint is often limited by self-occlusion and incomplete surface visibility. This paper presents DARP(Dual-Arm Robotic Perception) https://doi.org/10.21227/rmv3-be47, a calibrated dual-arm RGB-D-IR dataset for object-centered robotic perception using two independently moving eye-in-hand manipulators positioned on opposite sides of a shared tabletop workspace. Each arm carries an Intel RealSense sensor that continuously records RGB, depth, and stereo infrared data while synchronized robot joint states are logged for pose recovery. Objects are placed without fixed poses or marked locations, and the acquisition procedure performs automatic localization, cross-arm confirmation, adaptive viewpoint generation, and continuous multimodal recording. DARP contains ten unique tabletop objects and preserves the original sensor recordings, robot-state logs, object-level metadata, and calibration information required to reconstruct camera trajectories in a shared metric frame. To evaluate the geometric consistency of the acquisition, we implement a deterministic multi-view fusion pipeline that converts calibrated RGB-D observations into complementary partial point clouds and measured surface meshes without using learned or generative completion methods. Evaluation on 224 held-out RGB-D keyframes comprising 1,563,466 three-dimensional query points yields a median point-to-mesh distance of 2.13~mm and an RMSE of 4.04~mm, with 96.56\% of points within 10~mm of the measured-surface mesh. DARP is intended as a reusable resource for multi-view reconstruction, collaborative robotic perception, multimodal fusion, active perception, and future learning-based reasoning over partial object observations.

関連論文