何が起きたか

2026年7月22日にarXivプレプリントサーバーに公開された論文「Active Inference as a Convex Markov Decision Process」(識別番号2607.20152v1)は、Active Inference(AIF)における適応行動を期待自由エネルギー(EFE)最小化として捉え、閉ループ制御ポリシーに対してEFE最小化が凸マルコフ決定過程(MDP)として定式化可能であると主張している。論文は、実用的な項が予測状態周辺分布に対して線形であり、潜在MDPにおける報酬最大化と等価である一方、認識的価値が非線形成分を導入し、標準的な強化学習と区別されることを示した。さらに、有限ホライズン、割引、平均報酬の各定式化を分析し、現在の状態周辺分布の周りで目的関数を局所線形化する鏡像降下(MD)アルゴリズムを導出した。

詳細

論文は、AIFをポリシー最適化として捉え、EFE最小化が凸MDPとして表現できることを理論的に示した。この定式化では、実用的な目的(pragmatic terms)は予測状態周辺分布に対して線形であり、潜在MDPにおける報酬最大化と等価になる。一方、認識的価値(epistemic value)は非線形成分を導入し、EFE最小化を標準的な強化学習から区別する。この視点は、AIFの認識的駆動をポリシー依存(パフォーマティブ)報酬として明らかにする。 論文は、有限ホライズン、割引、平均報酬の各EFE定式化を分析し、現在の状態周辺分布の周りで目的関数を局所線形化する鏡像降下アルゴリズムを導出した。このアルゴリズムは、ポリシー依存報酬を生成し、アクタークリティカル法や動的計画法と互換性がある。さらに、世界モデルの学習とポリシー最適化の結合が、AIFにパフォーマティブ強化学習の構造を与えると論じ、現代の強化学習や最適化理論(収束解析や原理的なポリシー改善保証を含む)へのAIFの基盤付けの道筋を示した。

Key Facts

論文は2026年7月22日にarXivで公開された(識別番号2607.20152v1)。[1]
Active Inference(AIF)は適応行動を期待自由エネルギー(EFE)最小化として捉える。[1]
閉ループ制御ポリシーに対して、EFE最小化は凸マルコフ決定過程(MDP)として定式化できる。[1]
実用的な項は予測状態周辺分布に対して線形であり、潜在MDPにおける報酬最大化と等価である。[1]
認識的価値は非線形成分を導入し、EFE最小化を標準的な強化学習から区別する。[1]
認識的駆動はポリシー依存(パフォーマティブ)報酬として現れる。[1]
有限ホライズン、割引、平均報酬の各EFE定式化が分析された。[1]
鏡像降下(MD)アルゴリズムは目的関数を現在の状態周辺分布の周りで局所線形化する。[1]
導出されたアルゴリズムはアクタークリティカル法や動的計画法と互換性がある。[1]
世界モデルの学習とポリシー最適化の結合は、AIFにパフォーマティブ強化学習の構造を与えると論じられている。[1]

なぜ重要か

この研究は、Active Inferenceの理論的基盤を強化学習や最適化理論と結びつけるものであり、収束解析やポリシー改善の保証といった現代的な手法をAIFに適用する道を開く。凸MDPとしての定式化は、AIFの計算効率を高め、実用的な応用への橋渡しとなる可能性がある。