Jun Gao
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MeshPriorDiT: 行動条件付き布地ダイナミクスのための階層的モデリング布地シミュレーション2026/8/27
布地の動き予測を、メッシュGNNによる構造化された事前分布と、拡散トランスフォーマーによる生成的な残差に分解する階層モデルを提案し、長距離の協調と局所的な変形を両立させて予測精度を大幅に向上させた。
- DC-WAM: 動的焦点型視覚監視と推論によるワールド・アクションモデルVLA2026/7/1
ロボットの行動選択に重要な視覚ダイナミクスに焦点を当て、RGBビデオ予測の監視と推論を再設計したワールド・アクションモデルを提案した。
- OSCAR: ロボット工学のための全身体動作条件付きワールドモデルワールドモデル2026/6/1
ロボットのポリシー評価を可能にする、異なるロボット形態に汎化する高精度な動作条件付きビデオワールドモデルを提案した。大規模データパイプラインと2D骨格表現を用いて、実世界評価と相関する仮想評価を実現した。
- NVIDIA OmniDreams: 閉ループ自動運転シミュレーションのためのリアルタイム生成ワールドモデル自動運転シミュレーション2026/6/1
自動運転の閉ループシミュレーション向けに、拡散モデルを基盤としたリアルタイム生成ワールドモデルOmniDreamsを提案し、運転行動に応じたセンサ映像を自己回帰的に生成することで、従来の再構成ベースのシミュレータでは困難な長尾シナリオを合成可能にした。
- AFUN: 機能理解のためのアフォーダンス基盤モデルに向けてアフォーダンス/操作2026/6/1
単一のRGB-D観測と言語タスク記述から、タスク条件付き機能マスクと3D接触後動作曲線を予測するアフォーダンス基盤モデルを提案し、大規模データパイプラインによりオープンワールドでの汎化を実現した。
- Gamma-World: 2人を超える生成型マルチエージェント世界モデル世界モデル2026/5/27
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
- MoRight: モーション制御を正しく行う動画生成2026/4/1
ユーザー指定の動作で物体の動きを制御しつつ、カメラ視点も自由に変えられる動画生成フレームワークを提案。能動的動作と受動的反応を分離して因果関係を学習し、順方向・逆方向の推論を可能にした。
- 動画生成のための動き帰属分析動画生成2026/1/1
動画生成モデルにおいて、どの微調整クリップが時間的動きを改善・悪化させるかを特定する、動き中心の勾配ベースデータ帰属フレームワークを提案し、データ選別による動きの品質向上を実現した。
- TeraSim-World:エンドツーエンド自動運転のための世界規模の安全クリティカルデータ合成自動運転データ合成2025/9/1
任意の場所の地図・交通データを取得し、自然な運転行動と多様な危険シナリオをシミュレートして、映像生成モデルで写実的なセンサデータを合成する自動運転向けデータ生成パイプライン。
- ViPE: 3D幾何知覚のための動画ポーズ推定エンジン3D知覚2025/8/1
未校正の生動画からカメラ内部パラメータ・運動・密な深度を推定する汎用エンジンViPEを提案し、大規模動画データセットに正確な3Dアノテーションを付与して公開した。