日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
分子基盤モデルarXiv:2608.22642

Mol-JEPA: 分子のためのマルチモーダル統合予測アーキテクチャ

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

シェア:XThreadsFacebookLINEはてブBluesky

分子構造や細胞表現型など複数のデータモダリティを潜在空間で予測することで、化学的に無効な拡張やモダリティ崩壊などの問題を解決する分子基盤モデルを提案した。

詳しい要約

1. どんなもの?

Mol-JEPAは、分子の世界モデルを学習するためのスケーラブルなフレームワークです。分子構造、細胞表現型、結合親和性、ADMETプロファイル、量子化学シミュレーションなどの薬物発見データを活用し、モダリティマスキングを用いて潜在空間予測を行います。従来の分子ファウンデーションモデルの限界である化学的に無効なオーグメンテーション、モダリティ崩壊、生化学的環境の不完全な表現に対処します。

2. 先行研究と比べてどこがすごい?

先行研究では、分子の摂動に依存する手法が多く、化学的に無効なオーグメンテーションを生成する問題がありました。また、モダリティ崩壊や生化学的環境の不完全な表現も課題でした。Mol-JEPAは、摂動ではなくモダリティマスキングを用いることで、これらの問題を回避し、複数のデータモダリティを統合して生化学的文脈を潜在空間予測に組み込む点が優れています。

3. 技術・手法の肝は?

手法の肝は、モダリティマスキングを用いたJoint Embedding Predictive Architecture (JEPA)の採用です。分子構造、細胞表現型、結合親和性、ADMETプロファイル、量子化学シミュレーションなどの多様なデータを入力とし、一部のモダリティをマスクして、残りのモダリティから潜在空間で予測するように学習します。これにより、化学的に無効な摂動を避けつつ、生化学的文脈を捉えた表現を獲得します。

4. どうやって有効だと検証した?

複数のベンチマークで評価し、Mol-JEPAが学習した表現が強い性能を示すことを確認しました。具体的なベンチマーク名やタスクは要旨からは不明ですが、薬物発見に関連する様々な下流タスクでの性能が検証されたと述べられています。

5. 議論はある?

要旨からは、議論の詳細は不明ですが、モダリティマスキングの戦略や、異なるデータタイプの統合方法、スケーラビリティ、計算コストなどに関する議論が考えられます。また、潜在空間予測の有効性や、他のモデルとの比較についての議論も想定されますが、要旨には明記されていません。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていませんが、分子ファウンデーションモデルやJEPA関連の研究が関連します。具体的には、分子グラフニューラルネットワーク、トランスフォーマーベースの分子モデル、マルチモーダル学習、自己教師あり学習などの分野の論文が次に読むべき候補です。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

分類: cs.LG, cs.AI

原文アブストラクト

Despite recent advances in molecular foundation models, several limitations remain, such as chemically invalid augmentations, modality collapse, and incomplete representation of biochemical environments. To address these challenges, we present \textbf{Mol-JEPA}, a scalable framework for learning molecular world models. Rather than relying on suboptimal molecular perturbations, our model uses modality masking to exploit information from molecular structures, cellular phenotypes, binding affinities, ADMET profiles, quantum chemistry simulations and other drug discovery data. Across various benchmarks, we show that the representations learned by Mol-JEPA deliver strong performance, demonstrating the value of incorporating biochemical context through latent space prediction.