日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2608.12917

Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

シェア:XThreadsFacebookLINEはてブBluesky

詳しい要約

1. どんなもの?

本論文は、混雑環境におけるロボットナビゲーションのための深層強化学習(DRL)手法に、社会的に規範的な行動を組み込むための新しい報酬設計を提案している。具体的には、Hallのproxemics理論に基づき、各人間のパーソナルスペースを放射状のGaussian mixture fieldとしてモデル化し、ロボットの視野内でロボット中心の局所コストを計算する。この報酬を既存のDRLナビゲーション手法に統合し、シミュレーションで評価している。

2. 先行研究と比べてどこがすごい?

従来のDRLナビゲーション手法は、主にタスク中心の目的(例:目的地への到達)に焦点を当て、社会的規範の遵守(例:人間のパーソナルスペースの尊重)を十分に表現していなかった。本提案は、proxemicsに基づく密で解釈可能な報酬を導入することで、社会的コンプライアンスを明示的に学習信号に組み込み、ナビゲーション効率を維持しつつ社会的指標を改善する点が新しい。

3. 技術・手法の肝は?

手法の核は、proxemics理論に基づく報酬設計である。各人間のパーソナルスペースを放射状のGaussian mixture fieldでモデル化し、ロボットの視野内でロボット中心の局所コストを計算する。このコストは密で解釈可能な社会的学習信号を提供し、既存のDRLナビゲーション手法(例:SARL、CADRLなど)に統合される。報酬は、ナビゲーション効率(例:目的地への到達)と社会的規範(例:パーソナルスペースの侵害回避)のバランスを取るように設計されている。

4. どうやって有効だと検証した?

シミュレーション環境で、複数の混雑シナリオ、報酬ベースライン、混雑密度を用いて評価した。ナビゲーション指標(例:到着時間、衝突率)と社会的指標(例:パーソナルスペース侵害の頻度)の両方で比較した。結果、提案報酬は社会的指標を一貫して改善し、ナビゲーション性能は比較した報酬モデルと同等かそれ以上であることを示した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、シミュレーションでの評価に限定されており、実環境での検証が必要である可能性が示唆される。また、報酬設計のパラメータ(Gaussian mixtureの形状など)が結果に与える影響や、異なる文化圏でのproxemicsの差異についての議論は要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、既存のDRLナビゲーション手法(例:SARL、CADRL)や、proxemics理論(Hallの研究)が挙げられる。次に読むべき論文としては、これらの基礎となった論文や、社会的ナビゲーションのための他の報酬設計手法(例:social force modelに基づく報酬)が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Takieddine Soualhi, Jacques Saraydaryan, Laetitia Matignon

分類: cs.LG, cs.RO

原文アブストラクト

Developing effective robot navigation methods in crowded environments is essential for real-world applications. Although recent deep reinforcement learning (DRL) methods have improved navigation performance in crowded environments, they often focus primarily on task-centric objectives and underrepresent social compliance objectives. In this paper, we introduce a novel proxemics-based reward formulation for DRL social navigation that provides a dense, interpretable social learning signal while maintaining navigation efficiency. Our approach models each human's personal space as a radial Gaussian-mixture field derived from Hall's proxemics theory and computes a robot-centric local cost over the robot's field of view. We integrate the proposed reward into established DRL navigation methods and evaluate it in simulation across multiple crowd scenarios, reward baselines, and crowd densities using both navigation metrics and social metrics. Results show that the proposed reward consistently improves social metrics in simulation while maintaining competitive navigation performance relative to the compared reward models.