Roman Kniazev
収録論文 1本 ・ フィジカルAI/ロボット学習
解釈可能性
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- トランスフォーマーは高度に構造化された世界モデルを線形に表現する解釈可能性2026/5/13
数独の解法トレースで訓練したトランスフォーマーの内部表現を解析し、セル単位ではなく行・列・ボックス単位で世界モデルを構築し、最終MLP層に特定セルの候補が1つに絞られたことを検出する専用ニューロン群(裸のシングル回路)が存在することを発見した。