日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
データセットarXiv:2608.14767

NARRATE: 自動運転における人間中心の説明のためのマルチモーダル実世界オーストラリア運転データセット

NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

シェア:XThreadsFacebookLINEはてブBluesky

運転中のドライバー自身による説明を収集した実世界の運転データセットを構築し、状況認識や説明生成などのベンチマークタスクを提供した論文。

詳しい要約

1. どんなもの?

NARRATEは、オーストラリアの公道で収集されたマルチモーダルな運転データセットである。35人の経験豊富なドライバーと運転インストラクターから、2,050件の注釈付きイベントを収集し、各イベントは同期された視覚、位置情報、モーション、LiDARストリームに基づき、車内または運転後の自由記述による説明がペアになっている。アクションラベル、6つの高レベルと32の細粒度カテゴリからなるシナリオコンテキストラベル、およびドライバーの説明に対する知覚・理解・予測のスパンレベルのSituational Awareness (SA) アノテーションを提供する。

2. 先行研究と比べてどこがすごい?

既存の言語注釈付き運転データセットは、観察者による記述、事後的な説明、シミュレーション、またはセンサー入力から生成されたものが多く、運転行動を実行しているドライバー自身から引き出されたものではない。NARRATEは、実際の公道での運転中にドライバー自身が生成した説明を収集しており、この点で先行研究と一線を画す。また、SAアノテーションをスパンレベルで提供する点も独自性が高い。

3. 技術・手法の肝は?

手法の肝は、データ収集プロトコルとアノテーション構造にある。公道での実運転中に、車内および/または運転後にドライバーから自由記述の説明を引き出し、それを視覚・LiDAR・モーションなどのセンサーデータと同期させる。さらに、説明文に対してスパンレベルのSAアノテーション(Perception, Comprehension, Projection)を付与し、アクションラベルとシナリオコンテキストラベルを定義している。

4. どうやって有効だと検証した?

4つのベンチマークタスク(SA、シナリオコンテキスト、ドライバーアクション分類、説明生成)を設定し、ドライバーの言語からこれらの構造が学習可能であることを示した。一方で、細粒度のコンテキスト認識と説明生成は依然として困難であることが明らかになった。

5. 議論はある?

要旨からは、データセットの規模や収集環境の偏り(オーストラリアの公道のみ)に関する議論は不明である。また、説明生成の難しさから、モデルの改善余地が示唆されるが、具体的な限界や倫理的考慮については言及されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、運転データセット(例:BDD-X, HDD)や説明可能な自動運転に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li, Andry Rakotonirainy, Sebastien Glaser, Ronald Schroeter, Patricia Delhomme, Zahra Mehraban

分類: cs.CV, cs.AI, cs.CL, cs.RO

原文アブストラクト

Automated vehicles must explain their decisions in ways that passengers can understand, monitor, and trust. Existing language-annotated driving datasets are mostly observer-written, post-hoc, simulation-based, or generated from sensor inputs, rather than elicited from the driver performing the action. We introduce NARRATE, a multimodal real-world Australian driving dataset comprising 2,050 annotated events from 35 experienced drivers and driving instructors on public roads. Each event is grounded in synchronised visual, localisation, motion, and LiDAR streams and paired with in-vehicle and/or post-drive free-text explanations. NARRATE provides action labels, scenario-context labels spanning six high-level and 32 fine-grained categories, and span-level Situational Awareness (SA) annotations over driver explanations for Perception, Comprehension and Projection. Four benchmark tasks (SA, scenario-context, driver-action classification, and explanation generation) show that this structure is learnable from driver language, while fine-grained context recognition and explanation generation remain challenging. NARRATE paves a path towards more human-centred and domain-aware explanation models for automated driving.

関連論文