Mihir Prabhudesai
収録論文 11本 ・ フィジカルAI/ロボット学習
物理推論/LLM/強化学習画像生成拡散言語モデルマルチモーダル生成動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 物理シミュレータ上での強化学習による物理オリンピック問題解決物理推論/LLM/強化学習2026/4/1
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
- 反復的な自己修正による構成的画像生成の改善画像生成2026/1/1
視覚言語モデルを批評役として用い、テキスト画像生成モデルが複数ステップで生成を反復的に洗練させる手法を提案し、構成的なプロンプトでの生成精度を向上させた。
- データ制約下では拡散モデルが自己回帰モデルを上回る拡散言語モデル2025/7/1
データが乏しく計算資源が豊富な状況でマスク付き拡散言語モデルを系統的に検証し、自己回帰モデルより優れることとその理由(ランダムマスクによる暗黙のデータ拡張)を明らかにした。
- 統合マルチモーダル離散拡散モデルマルチモーダル生成2025/3/1
テキストと画像を統一的に理解・生成できる離散拡散モデルUniDiscを提案し、自己回帰型モデルより高性能かつ制御性・編集性・インペインティングに優れることを示した。
- 報酬勾配による動画拡散モデルのアラインメント動画生成2024/7/1
事前学習済み報酬モデルから動画拡散モデルへ勾配を逆伝播させ、少ない計算量とサンプルで下流タスクに適応させる手法を提案。
- Diffusion-TTA: Test-time Adaptation of Discriminative Models via Generative Feedback2023/11/1
- Aligning Text-to-Image Diffusion Models with Reward Backpropagation2023/10/1
- Your Diffusion Model is Secretly a Zero-Shot Classifier2023/3/1
- Test-time Adaptation with Slot-Centric Models2022/3/1
- 3D-OES: Viewpoint-Invariant Object-Factorized Environment Simulators2020/11/1
- Embodied Language Grounding with 3D Visual Feature Representations2019/10/1