何が起きたか

2026年8月31日にarxiv.orgで公開された論文で、半導体ファブの天井走行搬送システム(OHT)群の経路制御に、共有ニューラルネットワークを用いる「Neural Double Q-routing」が提案された。100台・150台・200台のOHTと到着率を組み合わせた9設定の模擬実験で、平均完了時間を表型Double Q-routing比で0.8%〜8.8%短縮し、150台・200台の6設定で比較手法中最良となった。

詳細

提案手法は、宛先別の表を共有の状態・行動価値ネットワークに置き換え、シミュレータ生成の軌跡に対する回帰で初期化した後、Double-Q更新・局所混雑補正・イベント層別リプレイでオンライン学習する。9設定のうち、完了タスク数は8設定で表型Double Q-routingの1%以内、95パーセンタイル完了時間は8設定で減少した。2つの起動シナリオでは、オフライン初期化により完了タスク数が最大23%、テール完了時間が最大15%改善した。

Key Facts

Neural Double Q-routingは、宛先別テーブルを共有の状態・行動価値ネットワークに置き換え、シミュレータ生成軌跡で初期化後、Double-Q更新・局所混雑補正・イベント層別リプレイでオンライン学習する。[1]
100・150・200台のOHTと到着率を組み合わせた9設定で、平均完了時間を表型Double Q-routing比で0.8%〜8.8%短縮した。[1]
150台・200台の6設定で平均完了時間が比較手法中最良となり、100台の3設定ではDijkstraが最良だった。[1]
完了タスク数は9設定中8設定で表型Double Q-routingの1%以内、95パーセンタイル完了時間は8設定で減少した。[1]
2つの起動シナリオで、オフライン初期化により完了タスク数が最大23%、テール完了時間が最大15%改善した。[1]

本紙の見方

本論文の核心は、半導体ファブのOHT群という大規模な実世界ロボットフリートの経路制御に、強化学習のスケーラビリティ問題を「共有ネットワーク」と「オフライン初期化」で解決した点にある。従来の表型Q-routingは宛先ごとに独立したテーブルを持つため、疎な状態では学習が進まず、起動時の性能が不安定だった。提案手法は宛先別テーブルを共有ネットワークに置き換えることで情報共有を促し、さらにシミュレータで生成した軌跡で事前学習することで、実運用開始時の性能を大幅に改善する。 この構造は、ロボットフリートの制御における「データの流れ」を意識している。シミュレータで軌跡を生成し、それを回帰で学習して初期化し、実運用でオンライン更新するという流れは、いわば「入力(交通状態)→処理(価値ネットワーク)→出力(経路選択)→データ(実績)→再学習(リプレイ)」というループを形成している。特に「イベント層別リプレイ」は、まれなイベントを重点的にサンプリングすることで、データの偏りを補正する工夫であり、実データが少ない起動期に有効だ。 業界構造への含意として、半導体ファブのOHTは、フォトマスクやウェハを搬送する重要設備であり、そのスループットは工場全体の生産性に直結する。従来の静的経路制御では時間変動する渋滞を考慮できず、大規模化に伴い性能が低下する。本手法は、100台規模ではDijkstraに劣るものの、150台・200台の大規模設定で優位に立つ。これは、OHT台数が増えるほど動的な交通制御の価値が高まることを示しており、半導体工場の大規模化・自動化の流れに沿った技術と言える。 一方で、未確定の論点も残る。論文はシミュレーション結果のみを示しており、実機での検証は行われていない。また、学習に必要な計算資源や、実際のファブで発生するセンサーノイズや故障へのロバスト性は不明だ。さらに、提案手法はOHTに特化しているが、他の搬送システム(AGVなど)への適用可能性も今後の課題だろう。

なぜ重要か

半導体工場の生産性は搬送効率に左右されるが、OHT台数が増えるほど従来の経路制御では限界がある。本手法は、大規模フリートで動的な交通制御を強化学習で実現し、シミュレーションで最大8.8%の完了時間短縮を示した。これは、半導体製造の自動化・大規模化に寄与する可能性があり、今後の実機適用が注目される。