Earl T. Barr
収録論文 1本 ・ フィジカルAI/ロボット学習
コード理解/LLM評価
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LLMは実行意味論をどれほど頑健に理解するかコード理解/LLM評価2026/2/24
コードの出力予測タスクに摂動を加え、LLMのコード理解の頑健性を評価。GPT-5.2は元ベンチマークで99%だが摂動で20-24%低下し、例外予測に弱いことを示した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
コードの出力予測タスクに摂動を加え、LLMのコード理解の頑健性を評価。GPT-5.2は元ベンチマークで99%だが摂動で20-24%低下し、例外予測に弱いことを示した。