Anthony Hughes
収録論文 1本 ・ フィジカルAI/ロボット学習
LLMセキュリティ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ToxScreen: LLMが毒されているかを検出するLLMセキュリティ2026/7/29
敵対者が訓練データにバックドアを仕込んだLLMを検出するためのベンチマークToxScreenを構築し、勾配ベースのプロンプト最適化は失敗するが、攻撃成功率で候補をランク付けするトークン探索が有効であることを示した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
敵対者が訓練データにバックドアを仕込んだLLMを検出するためのベンチマークToxScreenを構築し、勾配ベースのプロンプト最適化は失敗するが、攻撃成功率で候補をランク付けするトークン探索が有効であることを示した。