Amir Zadeh
収録論文 8本 ・ フィジカルAI/ロボット学習
表現学習物理推論/LLM/強化学習世界モデル画像生成VLA拡散言語モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 3D-DLP: 自己教師あり3Dオブジェクト中心シーン表現学習表現学習2026/6/1
RGB-Dやボクセル観測を3D潜在粒子に分解し、解釈可能で制御可能なオブジェクト中心表現を自己教師ありで学習するモデルを提案。ロボット操作タスクでの性能向上も確認。
- 物理シミュレータ上での強化学習による物理オリンピック問題解決物理推論/LLM/強化学習2026/4/1
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
- 潜在粒子世界モデル:自己教師ありのオブジェクト中心確率動的モデリング世界モデル2026/3/4
ビデオデータから教師なしでキーポイントやオブジェクトマスクを発見し、確率的な粒子動力学を学習する世界モデルを提案。実世界のマルチオブジェクトデータセットで最先端の性能を達成し、意思決定タスクにも応用可能。
- 反復的な自己修正による構成的画像生成の改善画像生成2026/1/1
視覚言語モデルを批評役として用い、テキスト画像生成モデルが複数ステップで生成を反復的に洗練させる手法を提案し、構成的なプロンプトでの生成精度を向上させた。
- NORA-1.5:世界モデルと行動に基づく選好報酬で訓練された視覚-言語-行動モデルVLA2025/11/1
事前学習済みNORAにフローマッチング行動エキスパートを追加し、世界モデルと正解からの逸脱を報酬とするDPOで事後学習することで、シミュレーションと実機の両方で信頼性と汎化性能を向上させたVLAモデル。
- AimBot: 視覚運動ポリシーの空間認識を高める簡易補助視覚キューVLA2025/8/1
多視点RGB画像に照準線とスコープを重ねてエンドエフェクタの状態を明示し、視覚運動ポリシーの性能を向上させる軽量な視覚拡張手法を提案。
- データ制約下では拡散モデルが自己回帰モデルを上回る拡散言語モデル2025/7/1
データが乏しく計算資源が豊富な状況でマスク付き拡散言語モデルを系統的に検証し、自己回帰モデルより優れることとその理由(ランダムマスクによる暗黙のデータ拡張)を明らかにした。
- NORA: 実世界タスク向け小型オープンソース汎用視覚言語行動モデルVLA2025/4/1
3Bパラメータのマルチモーダルモデルを基盤に97万件の実ロボット実演で学習し、大規模VLAより低計算コストで高いタスク性能を実現した。