日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
安全性arXiv:2608.28518v1

ロボットが聞き間違えるとき:音声操作型具現化AIの安全リスクのマッピング

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

シェア:XThreadsFacebookLINEはてブBluesky

音声認識の誤りが具現化AIの安全な動作を損なうことを示し、誤りをシミュレートして安全ベンチマークで評価した。

詳しい要約

1. どんなもの?

本論文は、ユーザー入力における自動音声認識(ASR)エラーが、具現化AI(EAI)モデルの安全でない出力につながるかどうかを調査した研究である。ASRエラーをシミュレートし、既存の安全ベンチマーク(SafeAgentBenchとPOEX)と組み合わせて、異なるエラーがEAIの安全性にどのように影響するかを評価している。

2. 先行研究と比べてどこがすごい?

先行研究では、ASRエラーが音声認識システム自体の性能に与える影響や、テキストベースのAIモデルの安全性が主に研究されてきた。本研究は、ASRエラーがEAIモデルの安全性に与える影響を初めて体系的に評価した点が新しい。特に、ASRエラーが有害な指示の受け入れや実行につながることを示し、EAIの安全性における音声入力の脆弱性を明らかにした。

3. 技術・手法の肝は?

手法の肝は、ASRエラーをシミュレートしてEAIモデルに入力し、その安全性を評価するパイプラインを構築した点である。具体的には、既存の安全ベンチマーク(SafeAgentBenchとPOEX)を使用し、ASRエラーを注入した入力に対するEAIモデルの応答を分析している。また、ASRエラーの種類(意味構造を保つが有害な曖昧性を増すもの、モデルの拒否行動を弱めるものなど)を分類し、それぞれの影響を評価している。さらに、ASRエラーの自動修正がリスクを低減できる場合があるが、常に有効ではないことも示している。

4. どうやって有効だと検証した?

有効性の検証は、SafeAgentBenchとPOEXのベンチマークを用いて、ASRエラーをシミュレートした入力に対するEAIモデルの安全性を評価することで行った。具体的には、ASRエラーが有害な指示の受け入れや実行につながるケースを特定し、エラーの種類ごとに安全性への影響を定量的に分析している。また、自動修正の効果についても検証し、その限界を示している。

5. 議論はある?

議論としては、ASRエラーがEAIの安全性に重大なリスクをもたらすことが示されたが、自動修正が常に有効ではないため、より堅牢な音声入力処理や安全機構の必要性が示唆される。また、本研究はシミュレートされたASRエラーを用いており、実際のASRシステムのエラー分布とは異なる可能性がある。さらに、EAIモデルの安全性評価はベンチマークに依存しており、実世界の多様なシナリオを完全にはカバーしていない可能性がある。

6. 次に読むべき論文は?

次に読むべき論文としては、SafeAgentBenchとPOEXの元論文が挙げられる。また、ASRエラーのシミュレーション手法や、EAIの安全性に関する他の研究も関連する。具体的には、SafeAgentBenchを提案した論文、POEXを提案した論文、およびASRエラーの影響を研究した音声認識分野の論文が参考になる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Sihan Jia, Oliver Lemon

分類: cs.AI, cs.CL, cs.RO

原文アブストラクト

We investigate whether automatic speech recognition (ASR) errors in user input can lead to unsafe outputs from Embodied AI (EAI) models. We find that ASR errors can lead to harmful instructions being accepted and executed by EAI models, thereby reducing safety. We simulate ASR errors and combine them with existing safety benchmarks (SafeAgentBench and POEX) to evaluate how different errors affect embodied AI safety. We find that some of them preserve semantic structure but increase harmful ambiguity, while others weaken the model refusal behaviour and allow unsafe plans to be generated and executed. We show that in some cases automatic correction of ASR errors can reduce the risk, but this is not always effective. Overall, we show that ASR errors lead to significant safety risks for embodied AI.

関連論文