何が起きたか
研究チームは、視覚・言語・行動モデル(VLA)である「Sigma」を構築し、単一のRTX 4090上で動作させた。Sigmaはオープンソースのpi0.5_baseを基盤とし、svla_so101_pickplaceデータセットを構造化して学習に用いた。評価では、未調整のpi0.5_baseと比較して制御MSEが一貫して低下し、意味整合性を維持した。
詳細
Sigmaは、意味論と連続制御の間の時間更新可能な媒介思考空間の欠如という根本的な限界に対処するため、独自のVLAアーキテクチャを導入している。このアーキテクチャは、深い意味理解と連想推論を統合し、知覚と行動の間のテレパシー的整合を実現する。学習プロセスは、データ前処理、LoRAベースの微調整、推論段階のアダプタ設計の反復最適化を通じて行われる。評価はオフラインの閉ループリプレイを用いて、同一データ条件下で未調整のpi0.5_baseと比較された。
Key Facts
| Sigmaは単一のRTX 4090上で動作するVLAモデルである。 | [1] |
| Sigmaはオープンソースのpi0.5_baseを基盤としている。 | [1] |
| 学習にはsvla_so101_pickplaceデータセットが使用された。 | [1] |
| 評価では、未調整のpi0.5_baseと比較して制御MSEが一貫して低下した。 | [1] |
| Sigmaはベースモデルを再学習することなく、意味的整合と意図駆動行動を実現する。 | [1] |
なぜ重要か
Sigmaは、VLAモデルの性能向上にアーキテクチャの変更が有効であることを示し、単一のGPUで動作する実用的なモデルとして、ロボット制御や自動運転などの分野での応用可能性を広げる。また、オープンソースの基盤モデルを活用することで、研究の再現性と発展を促進する。