Siyuan Zhou
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhysInOne: 一つのスイートで実現する視覚物理の学習と推論データセット/物理推論2026/4/1
物理現象を捉えた大規模合成動画データセットPhysInOneを構築し、物理に基づく映像生成や将来予測、物理特性推定などの性能向上を示した。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- RayletDF: 点群やガウシアンからの汎化可能な3D表面再構成のためのレイレット距離場3D再構成2025/8/1
クエリ光線から直接表面点を予測するレイレット距離場を提案し、点群や3Dガウシアンから高精度かつ未知データにも汎化する3D表面再構成を実現した。
- MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現VLA2025/7/1
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
- FreeGave: ガウス速度による動画からの3D物理学習3D物理学習2025/6/1
多視点動画から物体の事前情報なしに3Dシーンの物理運動を学習する手法を提案。ガウス速度場を推定し、未来フレーム予測と動きのセグメンテーションで高性能を示す。
- 3DFlowAction: 3Dフローワールドモデルから身体性を超えたマニピュレーションを学習マニピュレーション2025/6/1
人間とロボットの操作データから3D空間での物体の動きを予測するワールドモデルを学習し、言語指示に基づく3Dフローを生成してロボットの操作計画を導く手法を提案。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
- 3D永続的具現化ワールドモデルの学習ワールドモデル2025/5/1
過去に生成した内容を明示的に記憶する3Dマップを条件付けし、RGB-D動画拡散モデルで長期的に一貫した未来予測を可能にする永続的ワールドモデルを提案。計画や方策学習に有効性を示す。
- TesserAct: 4D身体化世界モデルの学習世界モデル2025/4/1
RGB-DN動画を生成するビデオモデルを微調整し、身体化エージェントの行動に応じた4Dシーン予測を可能にする世界モデルを提案。
- AdaWorld: 潜在行動で適応可能な世界モデルを学習する世界モデル2025/3/1
動画から自己教師ありで潜在行動を抽出し、それに条件づけた自己回帰的世界モデルを事前学習することで、新しい環境や行動への適応を効率化する手法を提案。
- RoboDreamer: ロボットの想像のための構成的世界モデルの学習世界モデル2024/4/1
言語指示を低レベルプリミティブに分解して動画生成を条件付けすることで、未見の物体と行動の組み合わせに対応できる構成的世界モデルを提案し、ロボットの計画生成を実現した。
- Adaptive Online Replanning with Diffusion Models2023/10/1
- Finding Fallen Objects Via Asynchronous Audio-Visual Integration2022/7/1
- PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics2021/4/1
- The ThreeDWorld Transport Challenge: A Visually Guided Task-and-Motion Planning Benchmark for Physically Realistic Embodied AI2021/3/1