Ali Farhadi
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- 上手くいく動作を模倣:人間動画からのシミュレーション選別モジュール型方策学習マニピュレーション2026/2/1
人間の動画から把持後の動作を学び、シミュレーションで把持の適合性を選別することで、ロボットデータなしに精密なマニピュレーションを実現するモジュール型方策学習フレームワークを提案。
- MolmoSpaces:ロボットナビゲーションとマニピュレーションのための大規模オープンエコシステムsim2real2026/2/1
23万以上の多様な屋内環境と13万の物体アセットを備え、MuJoCoやIsaacなど複数シミュレータで使えるオープンなロボットベンチマーク基盤を構築し、実機との高い相関を示した。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- 収束する機能、発散する形態:形態と制御の効率的な共設計フレームワークLOKI形態と制御の共設計2025/5/1
形態と制御方策を同時に設計する際、類似形態をクラスタ化して方策を共有し、局所探索で多様性を確保することで、計算コストを大幅に削減しつつ多様で汎用性の高いロボット形態を生成する手法を提案。
- DRAWER: 実環境のリアリズムを備えたデジタル再構築と関節構造の再現sim2real2025/4/1
室内シーンの動画から、細部まで再現されたフォトリアルで操作可能なデジタル環境を自動生成するフレームワークを提案し、ゲーム制作やロボティクスのsim-to-real転移に応用した。
- One RING:ロボット屋内ナビゲーションの汎用モデルナビゲーション2024/12/1
シミュレーションで大規模な機体形状のランダム化を行い、様々な実機ロボットに適応できる機体非依存の屋内ナビゲーション方策を学習した。
- 自分で説明書を作って組み立てることを学ぶマニピュレーション2024/10/1
LEGO組み立てタスクにおいて、エージェントが分解しながら画像を保存して自分用の説明書を作り、それを使って未知の組み立てを再現する手法を提案。
- FLaRe: 大規模強化学習ファインチューニングによる熟達した適応型ロボットポリシーVLA2024/9/1
事前学習済みロボットポリシーを大規模強化学習でファインチューニングし、未見環境での長期的移動操作タスクの成功率を大幅に向上させ、新しい身体や行動への迅速な適応を実現した。
- Moving Forward by Moving Backward: Embedding Action Impact over Action Semantics2023/4/1
- Self-Supervised Object Goal Navigation with In-Situ Finetuning2022/12/1
- Objaverse: A Universe of Annotated 3D Objects2022/12/1
- Phone2Proc: Bringing Robust Robots Into Our Chaotic World2022/12/1
- SAFER: Safe Collision Avoidance using Focused and Efficient Trajectory Search with Reinforcement Learning2022/9/1
- ProcTHOR: Large-Scale Embodied AI Using Procedural Generation2022/6/1
- Object Manipulation via Visual Target Localization2022/3/1
- LanguageRefer: Spatial-Language Model for 3D Visual Grounding2021/7/1
- Pushing it out of the Way: Interactive Visual Navigation2021/4/1
- RoboTHOR: An Open Simulation-to-Real Embodied AI Platform2020/4/1
- Use the Force, Luke! Learning to Predict Physical Forces by Simulating Effects2020/3/1
- Conditional Driving from Natural Language Instructions2019/10/1
- Learning to Learn How to Learn: Self-Adaptive Visual Navigation Using Meta-Learning2018/12/1
- Visual Semantic Navigation using Scene Priors2018/10/1
- Visual Semantic Planning using Deep Successor Representations2017/5/1
- You Only Look Once: Unified, Real-Time Object Detection2015/6/1