Jieyu Zhang
収録論文 6本 ・ フィジカルAI/ロボット学習
動作予測模倣学習sim2realVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoMotion: 言語指示による3D点軌跡予測動作予測2026/6/17
言語指示に基づいて物体上の3D点の将来軌跡を予測するモデルと、大規模データセット・ベンチマークを構築した論文。
- Demo-JEPA: ワンショット異種エンボディメント模倣のための共同埋め込み予測アーキテクチャ模倣学習2026/5/1
デモンストレーションを動作ではなく将来の目標状態として捉え、JEPAベースの世界モデルで視覚デモを目標エージェントの潜在軌跡に変換し、自己の学習済みダイナミクスで計画・実行する異種エンボディメント模倣フレームワークを提案。
- URDF-Anything+: シミュレーション可能な関節物体を単一画像からエンドツーエンド生成sim2real2026/3/1
単一のRGB画像から、関節パラメータを含むシミュレーション実行可能なURDFモデルを自己回帰拡散モデルで直接生成する手法を提案。
- URDF-Anything: 3Dマルチモーダル言語モデルによる関節物体の構築sim2real2025/11/1
点群とテキストを入力とする3Dマルチモーダル大規模言語モデルで、関節物体の幾何分割と運動学パラメータをエンドツーエンドに予測し、ロボットシミュレーション用デジタルツインを自動生成する手法を提案。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- H2R: 動画からのロボット事前学習のための人間からロボットへのデータ拡張sim2real2025/5/1
一人称視点の人間動画をロボット視点の映像に変換するデータ拡張パイプラインH2Rを提案し、人間とロボットの見た目のギャップを埋めることで、シミュレーションと実機の両方で下流タスクの成功率を向上させた。