Seonghyeon Ye
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboWorld: 汎用ロボットポリシー評価のための高速で信頼性の高いニューラルシミュレータシミュレーション/評価2026/7/1
ビデオワールドモデルを用いてロボットポリシーを評価する自動パイプラインを提案し、新しいStep Forcing手法で長期的なロールアウトの信頼性を高め、実世界評価と高い相関を達成した。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- Magma: マルチモーダルAIエージェントのための基盤モデルVLA2025/2/1
画像・動画・ロボットデータを統合的に学習し、UI操作からロボットマニピュレーションまでこなすマルチモーダル基盤モデルを提案。
- 動画からの潜在行動事前学習VLA2024/10/1
ロボットの行動ラベルなしでインターネット規模の動画からVLAモデルを事前学習する手法を提案し、実世界のマニピュレーションタスクで既存手法を上回る性能を示した。