Florian Lemmerich
収録論文 1本 ・ フィジカルAI/ロボット学習
LLM評価
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AuAu: 大規模言語モデルにおける権威主義的整合性の監査のためのベンチマークLLM評価2026/6/15
大規模言語モデル(LLM)の応答における権威主義的傾向を評価する包括的なベンチマーク「AuAu」を提案し、17モデルを評価して権威主義的応答率やシステムプロンプトによる操作可能性を明らかにした。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
大規模言語モデル(LLM)の応答における権威主義的傾向を評価する包括的なベンチマーク「AuAu」を提案し、17モデルを評価して権威主義的応答率やシステムプロンプトによる操作可能性を明らかにした。