日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
検索拡張対話/サービスルーティングarXiv:2609.10372

PACE: 体感遅延を考慮したカスケードサービスルーティングとフィラー制御によるQoE効率の高い検索拡張対話サービス

PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

シェア:XThreadsFacebookLINEはてブBluesky

人間型ロボット販売サービス向けに、応答ソースの選択と待機時間の埋め合わせを同時制御し、体感初回応答時間を最小化する検索拡張対話配信フレームワークを提案・実証した。

詳しい要約

1. どんなもの?

- 本論文は、retrieval-augmented dialogue serving のための PACE フレームワークを提案する。 - Perceived Time-to-First-Response (PTFR) を QoE 目的として定式化し、品質/コスト制約下で最小化する。 - 人間型ロボット販売サービスに展開され、load-adaptive cascading router、joint path-filler controller、volatility-aware cache admission の3機構を組み合わせる。 - 75k CarQA リクエストで評価。

2. 先行研究と比べてどこがすごい?

- 従来の cascaded routing、semantic caching、adaptive retrieval と異なり、PACE は応答を構成する answer source と待機時間を埋める filler を同時に制御する。 - カスケードにより pure-LLM の PTFR を P95 で半減(c16 で 0.29 vs 0.53s)。 - 適応コントローラは高負荷時に RAG より 2.4 倍優れ、同等品質を達成。 - filler コントローラは呼び出しを 94% 削減し、競合ゼロ。 - volatility-aware admission は古い回答を 86% から 0% に削減。 - ゲーティングルールによりコントローラはベースラインより悪化せず、露出は1ホールド期間に制限。 - 展開サービスにおける filler-answer conflict risk の初の定量化。

3. 技術・手法の肝は?

- load-adaptive cascading router:負荷に応じて answer source をカスケード的に選択。 - joint path-filler controller:待機ウィンドウを埋める filler を制御。 - volatility-aware cache admission:キャッシュの陳腐化を考慮した admission 制御。 - これらを統合し、PTFR を QoE 目的として品質/コスト制約下で最小化。

4. どうやって有効だと検証した?

- 75k CarQA リクエストを用いて評価。 - カスケードは pure-LLM の PTFR を P95 で半減(c16 で 0.29 vs 0.53s)。 - 適応コントローラは高負荷時に RAG より 2.4 倍優れ、同等品質。 - filler コントローラは呼び出しを 94% 削減し、競合ゼロ。 - volatility-aware admission は古い回答を 86% から 0% に削減。 - ゲーティングルールによりベースラインより悪化しないことを確認。

5. 議論はある?

- filler-answer conflict risk の定量化は初。 - ゲーティングルールによりコントローラがベースラインより悪化しないことを保証し、露出は1ホールド期間に制限。 - その他の議論や限界は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:cascaded routing、semantic caching、adaptive retrieval、RAG。 - 関連手法として retrieval-augmented dialogue serving や QoE 最適化に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Lin Huang, Yujuan Tan, Weisheng Li, Lixiang Zeng, Kun Yang, Suihan Xiao

分類: cs.CV, cs.AI, cs.RO

原文アブストラクト

We present the PACE, a framework for retrieval-augmented dialogue serving that formalizes Perceived Time-to-First-Response (PTFR) as a QoE objective and minimizes it under quality/cost constraints. Unlike prior work on cascaded routing, semantic caching, or adaptive retrieval, PACE jointly controls which answer source composes the response and what fills the waiting window. Deployed on a humanoid-robot sales service, it combines three mechanisms: a load-adaptive cascading router, a joint path-filler controller, and volatility-aware cache admission. On 75k CarQA requests, the cascade halves pure-LLM PTFR at P95 (0.29 vs 0.53s at c16). The adaptive controller reaches 0.41s P95, outperforming RAG by 2.4 times at high load with equal quality. The filler controller cuts calls by 94% with zero conflict. Volatility-aware admission reduces stale answers from 86% to 0%. A gating rule ensures the controller never worse than the baseline, with exposure bounded by one hold period. This is the first quantification of filler-answer conflict risk in deployed services.