日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
社会的ロボティクスarXiv:2609.15455

InterSocialBench:コンパニオンロボットの社会的行動に対する人間とLLMの選好を評価するベンチマーク

InterSocialBench: Benchmarking Human and LLM Preferences for Companion-Robot Social Behavior

シェア:XThreadsFacebookLINEはてブBluesky

家庭内の210シナリオと18の高レベル行動について、100人の人間の判断と7つのLLMの応答を収集し、コンパニオンロボットの社会的行動選択における人間とLLMの選好の違いを評価するベンチマークを提案した。

詳しい要約

1. どんなもの?

Companion robot が日常で直面する、複数の行動候補があり人によって好みが分かれる状況を扱うベンチマーク InterSocialBench を提案。 - 210 の domestic scenario と 18 の high-level behavior を含む。 - 100 人の human participant の判断と、7 つの large language model による 23,520 の応答を 16 の personality condition 下で収集。 - 各 human annotation は preferred action と、明示的な appropriate / inappropriate candidate を保持。 - 構造化された構築 pipeline で behavioral alternative、競合する situational cue、関連する history と future task を網羅。 - 評価は preferred-choice agreement と explicit rejection を区別し、trainab…

2. 先行研究と比べてどこがすごい?

要旨からは先行研究との直接比較は不明。 - 単一の consensus label に置き換えず、個人の判断を保持して social behavior selection を評価する点を特徴とする。 - human と LLM の分布差、特に diversity gap を定量化する枠組みを提供。 - ただし既存 benchmark との優劣や差分は要旨では明示されていない。

3. 技術・手法の肝は?

210 domestic scenario と 18 high-level behavior からなる benchmark を構築。 - 100 人の human participant の判断と、7 つの LLM の 16 personality condition 下での 23,520 応答を収集。 - 各 human annotation に preferred action と appropriate / inappropriate candidate を付与。 - behavioral alternative、競合する situational cue、history と future task を含む構造化 pipeline。 - 評価は preferred-choice agreement と explicit rejection を分離し、scenario-grouped split で trainable predictor を評価。 - simple frequency と persona-voting baseline を例示。

4. どうやって有効だと検証した?

InterSocialBench を用いた評価を実施。 - preferred-choice agreement と explicit rejection を区別して評価。 - scenario-grouped split で trainable predictor を検証。 - simple frequency と persona-voting baseline を比較例として提示。 - 結果として model と human の行動分布が異なり、応答数を揃えても diversity gap が残存。 - human は scenario あたり 4.68 の distinct choice を示し、model は 2.06–3.46。 - human の scenario-level plurality agreement は 51.5% で、普遍的な prediction ceiling ではなく disagreement を記述。

5. 議論はある?

要旨では、human と model の行動分布の差、および応答数を揃えても残る diversity gap が議論されている。 - human の scenario あたり distinct choice は 4.68 で、model の 2.06–3.46 より多い。 - human の scenario-level plurality agreement は 51.5% であり、これは disagreement を示す。 - InterSocialBench は単一の consensus label に個人判断を置き換えずに social behavior selection を評価可能とする。 - その他の議論や限界は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照・比較されている研究は明示されていない。 - 関連手法として、simple frequency baseline と persona-voting baseline が挙げられている。 - 同分野の定番として、human-robot interaction における social behavior selection、LLM の personality 条件付き応答評価、preference learning に関する研究が次に読む候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yaodan Xu, Boyang Guo, Yuqing Gu, Qingxin Zhang, Yiwen Deng, Meng Liu, Lintian Li

分類: cs.RO

原文アブストラクト

Companion robots face everyday situations in which several feasible behaviors may be appropriate, yet different people prefer different responses. We introduce InterSocialBench, a benchmark of 210 domestic scenarios and 18 high-level behaviors, pairing judgments from 100 human participants with 23,520 responses from seven large language models under 16 personality conditions. Each human annotation preserves a preferred action alongside explicitly appropriate and inappropriate candidates. A structured construction pipeline covers behavioral alternatives, competing situational cues, and relevant history and future tasks. Evaluation distinguishes preferred-choice agreement from explicit rejection, using scenario-grouped splits for trainable predictors. Simple frequency and persona-voting baselines illustrate these objectives. Across the tested prompts, model and human behavior distributions differ, and the diversity gap remains after matching response counts: humans exhibit 4.68 distinct choices per scenario, compared with 2.06--3.46 for the models. Human scenario-level plurality agreement is 51.5%, describing disagreement rather than a universal prediction ceiling. InterSocialBench supports evaluating social behavior selection without replacing individual judgments with a single consensus label.

関連論文