日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:1706.03762

Attention Is All You Need

Attention Is All You Need

シェア:XThreadsFacebookLINEはてブBluesky
🏛 フィジカルAI 必読論文基盤技術(ロボット基盤モデルが依拠)
本論文は、2017年にVaswaniらによって発表された、Transformerアーキテクチャを提案したものである。従来の系列変換モデルが再帰型ニューラルネットワークや畳み込みに依存していたのに対し、本論文は注意機構のみを用いて系列全体を処理することを可能にした。具体的には、エンコーダとデコーダを構成する各層で、自己注意と相互注意を多頭注意として並列に計算し、位置情報を正弦波ベースの位置エンコーディングで付加する。これにより、再帰や畳み込みを一切用いずに、系列内の任意の位置間の依存関係を直接モデル化できる。 仕組みの核心は、クエリ、キー、バリューの3つのベクトルを入力から線形変換で生成し、クエリとキーの内積をスケーリングしてソフトマックスを適用することで、各位置が他の位置にどれだけ注意を向けるかを計算する点にある。多頭注意はこれを複数の部分空間で並列に行い、異なる表現を学習する。また、残差接続と層正規化を各サブ層に組み込み、深いネットワークの学習を安定化させている。位置エンコーディングは、系列の順序情報をモデルに与えるために必須であり、学習可能なバージョンも提案されているが、正弦波版が外挿性に優れるとされた。 画期的だった点は、従来のRNNが抱える逐次処理による並列化の困難さと長距離依存性の勾配消失問題を根本的に解決したことである。RNNでは系列を順に処理するため、長い系列では計算時間が増大し、遠い位置の情報が失われやすかった。Transformerは全位置を同時に処理できるため、GPUなどの並列計算を最大限に活用でき、訓練時間を大幅に短縮した。また、注意機構は任意の位置間の依存関係を直接捉えるため、長距離依存性の学習が容易になり、機械翻訳や言語モデリングで当時の最先端を大きく上回る性能を達成した。 フィジカルAIへの影響は計り知れない。Transformerは自然言語処理で確立された後、画像認識や点群処理など視覚・空間データにも応用され、Vision TransformerやPerceiverなどの基盤モデルの基礎となった。ロボット分野では、このアーキテクチャが視覚と言語を統合する視覚言語行動モデルの中心的な構成要素となり、ロボットのタスク計画や操作制御に利用されている。例えば、RT-1やRT-2などのロボット基盤モデルは、Transformerのエンコーダ・デコーダ構造を用いて、カメラ画像と自然言語指示を入力とし、行動トークンを出力する。また、自己注意機構は、ロボットが環境内の複数の物体や関節の状態を同時に関連付けることを可能にし、複雑な操作タスクにおける空間的推論を強化する。さらに、Transformerの並列処理特性は、実時間制御における推論速度の向上にも寄与し、シミュレーションから実機への転移学習や、マルチモーダルセンサフュージョンにも応用されている。このように、本論文はフィジカルAIの基盤となる汎用アーキテクチャを提供し、ロボットの知覚、計画、制御の統合を大きく前進させた。

※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。

分類: landmark

関連論文基盤技術(ロボット基盤モデルが依拠)