何が起きたか

2026年7月23日、arxiv.orgに掲載された論文で、LeAct(Learning to Reason from Expert Actions)という新しい学習手法が発表された。この手法は、専門家システムが生成する行動のみから、その背後にある思考過程を自然言語の推論として復元することを目指す。実験では、不完全情報ゲームやロボティクスベンチマークで、既存の専門家反復ベースラインよりも優れた性能を示した。

詳細

LeActは、専門家システムの行動を観察し、その行動を生成する可能性のある思考過程(CoT)を潜在変数として扱い、最適化する。具体的には、学生モデルが各専門家行動に対して候補となるCoTをサンプリングし、そのCoTが自身の行動再現確率を改善するものを保持する。実験では、小規模な列挙可能なゲームでソルバーの数値的限界に達し、大規模なFlop Hold'em(約10^9情報集合)では、専門家反復ベースラインと比較して5倍ソルバーに近づき、直接対戦で+60 mbb/gの勝利を収めた。また、ロボティクスプローブでは、直接模倣を改善する唯一の訓練手法であった。

Key Facts

LeActは、専門家システムの行動から思考過程を復元する新しい学習手法である。[1]
LeActは、小規模な列挙可能なゲームでソルバーの数値的限界に達した。[1]
大規模なFlop Hold'em(約10^9情報集合)では、LeActは専門家反復ベースラインより5倍ソルバーに近く、直接対戦で+60 mbb/gの勝利を収めた。[1]
ロボティクスプローブでは、LeActは直接模倣を改善する唯一の訓練手法であった。[1]
LeActは、専門家システムを基礎モデルの新しい推論教師として位置づける。[1]

本紙の見方

今回のLeActの発表は、AI分野における推論データの調達方法に一石を投じるものだ。従来、推論モデルの訓練には人間の注釈や強力なLLMからの蒸留が用いられてきたが、LeActはゲームエンジンや古典的プランナー、定理証明器といった専門家システムに着目する。これらのシステムは行動を出力するが、その背後にある思考過程を明示しないため、これまで推論データの源として活用されていなかった。LeActはこの「沈黙の専門家」から、行動のみを手がかりに思考過程を復元する点で新規性が高い。 本紙の過去報道との接続はないが、この研究はAIの学習データ不足という業界課題に対する一つの解答を示している。特に、ロボティクス分野では、実世界でのデータ収集が困難であるため、シミュレーションや専門家システムからの学習が重要視されている。LeActがロボティクスプローブで直接模倣を改善したことは、この分野での応用可能性を示唆する。 業界構造への含意として、LeActは専門家システムを「推論教師」として再利用する枠組みを提供する。これにより、ゲームAIやプランニング、定理証明などの分野で蓄積された専門知識を、基礎モデルの訓練に活用できる可能性がある。一方で、専門家システムの行動が必ずしも最適でない場合や、思考過程の復元が不完全な場合の影響は未検証であり、今後の研究が待たれる。 未確定の論点としては、LeActが大規模な実世界タスクでどの程度有効か、また復元された思考過程の品質をどう評価するかが挙げられる。さらに、専門家システムの種類によって性能がどう変わるかも重要な検討事項だ。

なぜ重要か

LeActは、AIの推論能力向上に必要なデータを、これまで活用されていなかった専門家システムから得る道を開く。これにより、データ不足に悩む分野での基礎モデルの性能向上が期待される。また、専門家システムの知識を自然言語の推論として抽出する手法は、AIの解釈可能性や説明可能性にも寄与する可能性がある。