Sanja Fidler
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TRON: 3Dガウス再構成のためのニューラルレンダラをオーケストレーションする光線追跡ニューラルレンダリング2026/6/9
3Dガウス表現に光線追跡とニューラルレンダリングを組み合わせ、実シーンの再照明や動的物体操作、マテリアル編集を可能にするレンダリングフレームワークを提案。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- NVIDIA OmniDreams: 閉ループ自動運転シミュレーションのためのリアルタイム生成ワールドモデル自動運転シミュレーション2026/6/1
自動運転の閉ループシミュレーション向けに、拡散モデルを基盤としたリアルタイム生成ワールドモデルOmniDreamsを提案し、運転行動に応じたセンサ映像を自己回帰的に生成することで、従来の再構成ベースのシミュレータでは困難な長尾シナリオを合成可能にした。
- GRAIL: 3Dアセットとビデオ事前知識から人型ロコ操作を生成ロコ操作2026/6/1
物理環境や遠隔操作を必要とせず、3Dアセットとビデオ基盤モデルの事前知識を用いて、人型ロボットの全身操作デモを仮想的に生成するパイプラインを提案した。
- DriveJudge: 視覚言語モデルによる自動運転評価の再考自動運転評価2026/6/1
自動運転の評価を、ルールベースの物理的根拠と視覚言語モデルの文脈理解を組み合わせたエージェントDriveJudgeを提案し、大規模データセットで人間の判断と高い一致を示した。
- Gamma-World: 2人を超える生成型マルチエージェント世界モデル世界モデル2026/5/27
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
- MoRight: モーション制御を正しく行う動画生成2026/4/1
ユーザー指定の動作で物体の動きを制御しつつ、カメラ視点も自由に変えられる動画生成フレームワークを提案。能動的動作と受動的反応を分離して因果関係を学習し、順方向・逆方向の推論を可能にした。
- Kimodo: 制御可能な人間動作生成のスケーリング動作生成2026/3/1
700時間の光学モーションキャプチャデータで訓練した、テキストやキネマティック制約で制御可能な高品質な人間動作生成モデルを提案した論文。
- 動画生成のための動き帰属分析動画生成2026/1/1
動画生成モデルにおいて、どの微調整クリップが時間的動きを改善・悪化させるかを特定する、動き中心の勾配ベースデータ帰属フレームワークを提案し、データ選別による動きの品質向上を実現した。
- RadarGen: カメラ画像からの車載レーダ点群生成拡散モデル/レーダ生成2025/12/1
マルチビューカメラ画像から拡散モデルを用いてリアルな車載レーダ点群を生成する手法を提案し、知覚モデルの性能ギャップを縮小した。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- ViPE: 3D幾何知覚のための動画ポーズ推定エンジン3D知覚2025/8/1
未校正の生動画からカメラ内部パラメータ・運動・密な深度を推定する汎用エンジンViPEを提案し、大規模動画データセットに正確な3Dアノテーションを付与して公開した。
- Cosmos-Transfer1:適応的マルチモーダル制御による条件付きワールド生成sim2real2025/3/1
セグメンテーション・深度・エッジなど複数モダリティの空間制御入力を場所ごとに重み付けして世界シミュレーションを生成するモデルを提案し、ロボティクスのSim2Realや自動運転データ拡張への応用とリアルタイム推論を実証した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- DistillNeRF: 単眼画像からニューラル場と基盤モデル特徴を蒸留して3Dシーンを認識3D認識2024/6/1
単一フレームの多視点カメラ画像から、NeRFの蒸留とCLIP/DINOv2などの2D基盤モデル特徴の蒸留を組み合わせて、自己教師ありで3Dシーン表現を学習する手法を提案。
- ARSim: マルチビュー一貫性を備えた拡張現実ベースの自動運転知覚向け合成データ生成sim2real2024/3/1
実車のマルチカメラ映像に3D合成物体を自動で合成し、ドメイン適応とランダム化でリアルとシミュレーションのギャップを埋めることで、自動運転の知覚ネットワーク学習用データを拡張するフレームワークを提案した。
- Trajeglish: Traffic Modeling as Next-Token Prediction2023/12/1
- Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory Diffusion2023/4/4
- VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion2023/2/1
- PADL: Language-Directed Physics-Based Character Control2023/1/31
- Generating Useful Accident-Prone Driving Scenarios via a Learned Traffic Prior2021/12/1
- DriveGAN: Towards a Controllable High-Quality Neural Simulation2021/4/1
- gradSim: Differentiable simulation for system identification and visuomotor control2021/4/1
- UniCon: Universal Neural Controller For Physics-based Character Motion2020/11/1
- The efficacy of Neural Planning Metrics: A meta-analysis of PKL on nuScenes2020/10/1
- Kaolin: A PyTorch Library for Accelerating 3D Deep Learning Research2019/11/1
- Neural Graph Evolution: Towards Efficient Automatic Robot Design2019/6/1