日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.12917v1

近接学に基づく報酬モデリングによる深層強化学習の社会的に適合したナビゲーション

Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

シェア:XThreadsFacebookLINEはてブBluesky

混雑環境でのロボットナビゲーションにおいて、社会的規範を考慮した報酬を近接学理論に基づいて設計し、深層強化学習に組み込むことで、ナビゲーション性能を保ちつつ社会的指標を改善する手法を提案した。

詳しい要約

1. どんなもの?

本論文は、混雑環境におけるロボットナビゲーションのための深層強化学習(DRL)手法に、社会的に規範的な行動を組み込むための新しい報酬設計を提案している。具体的には、Hallのproxemics理論に基づき、各人間のパーソナルスペースを放射状のGaussian mixture fieldとしてモデル化し、ロボットの視野内でロボット中心の局所コストを計算する。このproxemics-based rewardを既存のDRLナビゲーション手法に統合し、シミュレーションで評価している。

2. 先行研究と比べてどこがすごい?

従来のDRLナビゲーション手法は、主にタスク中心の目的(例:目的地への到達、衝突回避)に焦点を当てており、社会的規範(例:パーソナルスペースの尊重)を十分に表現していなかった。本提案は、proxemics理論に基づく密で解釈可能な報酬を導入することで、社会的コンプライアンスを明示的に学習信号に組み込み、ナビゲーション効率を維持しながら社会的指標を改善する点が新しい。

3. 技術・手法の肝は?

手法の核は、proxemics-based rewardの設計にある。各人間のパーソナルスペースを放射状のGaussian mixture fieldでモデル化し、ロボットのセンサー範囲(field of view)内でロボット中心の局所コストを計算する。このコストは、ロボットが人間のパーソナルスペースに侵入する度合いに応じてペナルティを与える。報酬は密であり、解釈可能で、既存のDRLナビゲーション手法(例:特定のアルゴリズム)に統合可能である。

4. どうやって有効だと検証した?

シミュレーション環境で、複数の混雑シナリオ、報酬ベースライン、混雑密度を用いて評価した。ナビゲーション指標(例:到着時間、衝突率)と社会的指標(例:パーソナルスペース侵入度)の両方で比較した。結果、提案報酬は社会的指標を一貫して改善し、ナビゲーション性能は比較した報酬モデルと同等かそれ以上を維持した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、シミュレーションでの評価のみであり、実環境での検証が必要であること、またproxemics理論のパラメータ設定(例:Gaussianの広がり)が結果に影響する可能性が考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、proxemics理論(Hallの理論)とDRLナビゲーション手法が挙げられる。次に読むべき論文としては、proxemics-based social navigationの基礎研究や、DRLナビゲーションの代表的な手法(例:Socially Aware Navigation, CrowdNav)が考えられるが、要旨に具体的な論文名は記載されていないため、同分野の定番である「Socially Aware Navigation」や「CrowdNav」を挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Takieddine Soualhi, Jacques Saraydaryan, Laetitia Matignon

分類: cs.LG, cs.RO

原文アブストラクト

Developing effective robot navigation methods in crowded environments is essential for real-world applications. Although recent deep reinforcement learning (DRL) methods have improved navigation performance in crowded environments, they often focus primarily on task-centric objectives and underrepresent social compliance objectives. In this paper, we introduce a novel proxemics-based reward formulation for DRL social navigation that provides a dense, interpretable social learning signal while maintaining navigation efficiency. Our approach models each human's personal space as a radial Gaussian-mixture field derived from Hall's proxemics theory and computes a robot-centric local cost over the robot's field of view. We integrate the proposed reward into established DRL navigation methods and evaluate it in simulation across multiple crowd scenarios, reward baselines, and crowd densities using both navigation metrics and social metrics. Results show that the proposed reward consistently improves social metrics in simulation while maintaining competitive navigation performance relative to the compared reward models.