日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
音声対話arXiv:2609.00648v1

騒がしい公共空間における複数参加者とのヒューマンロボット対話

Human-robot conversation with multiple participants in noisy public spaces

シェア:XThreadsFacebookLINEはてブBluesky

騒音の多い公共空間で、ロボットやアバターが複数人と会話するための音声強調システムを提案し、2025年大阪万博で実証した。

詳しい要約

1. どんなもの?

本論文は、騒がしい公共空間(例:2025年大阪・関西万博の実証デモ)において、複数参加者との対話を行うロボット/アバター向けの音声システムを提案する。単一のmulti-channel microphone arrayを用いて、複数話者の音声強調と、アバターを介した遠隔操作者への没入感のある空間音響(spatial audio)の提供を実現する。具体的には、アンドロイドERICAを用いた傾聴システムと、遠隔操作者のアバターとして機能する移動型Telecoロボットによる会話支援システムの2シナリオを想定する。

2. 先行研究と比べてどこがすごい?

従来のspoken dialogue systemは、静粛な環境や単一話者を前提とすることが多いが、本提案は実環境の騒音下で複数話者を扱う点が新しい。また、音声強調を音声認識だけでなく、遠隔操作者へのクリーンな音声伝送にも活用し、さらにspatial audioによりアバター対話の没入感を高める点が、既存のロボット音声システムと比べて優れている。

3. 技術・手法の肝は?

技術の肝は、単一のmulti-channel microphone arrayを用いて、複数話者の音声を空間的に分離・強調する音声処理と、その強調信号を音声認識または遠隔伝送に利用する点。さらに、話者の位置情報に基づくspatial audioを生成し、遠隔操作者に臨場感のある音場を提供する。システムは、ロボット(ERICA、Teleco)に統合され、実環境でのproof-of-conceptとして設計されている。

4. どうやって有効だと検証した?

2025年World Expo in Osakaでの実証デモにより有効性を検証した。具体的な評価指標(認識精度、主観評価など)は要旨からは不明だが、実環境での動作実証を通じて、騒音下での複数話者音声強調とアバター対話の没入感を確認したとしている。

5. 議論はある?

要旨からは、実環境での性能限界や、複数話者数・雑音レベルの変化に対する頑健性、spatial audioの主観的効果の詳細な評価などは不明。また、単一のmicrophone arrayで複数話者を扱う際のチャネル数や処理コストの制約についても議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、multi-channel microphone arrayを用いた音源分離・強調(例:beamforming、blind source separation)や、ロボットのspoken dialogue system、telepresence/avatarシステムに関する論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

分類: cs.RO, cs.HC

原文アブストラクト

For noisy real-world environments such as those in open public spaces, spoken dialogue systems for both autonomous robots and avatars should be carefully designed to provide enhanced speech signals. These signals can be used either for speech recognition or, in the case of an avatar system, transmitted as clean speech to a remote operator. This work proposes an audio system that can be used for both these scenarios and was demonstrated as a proof-of-concept at the 2025 World Expo in Osaka. The first scenario is an attentive listening system with the android ERICA, and the second is a conversation support system with mobile Teleco robots, with one of them acting as an avatar for a remote operator. Both systems feature multi-party conversation and use a single multi-channel microphone array. We describe how our audio system not only enhances the speech of multiple speakers in a noisy environment, but provides a form of spatial audio which allows for more immersiveness in avatar-based conversational interactions.