Jonathan Drechsel
収録論文 1本 ・ フィジカルAI/ロボット学習
解釈可能性
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 言語モデルにおける介入と検出のための勾配と活性化:ターゲット特徴学習解釈可能性2026/9/26
言語モデル内の特定概念に対応する特徴を、活性化値・活性化勾配・パラメータ勾配と2種の推定器の組み合わせで学習し、検出と因果介入の性能を比較した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
言語モデル内の特定概念に対応する特徴を、活性化値・活性化勾配・パラメータ勾配と2種の推定器の組み合わせで学習し、検出と因果介入の性能を比較した。