Haoquan Fang
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA操作マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- 再帰的深さを持つVLA:潜在的反復推論による視覚言語行動モデルのテスト時計算スケーリングVLA2026/2/1
重み共有の再帰的な行動ヘッドを用いて、推論時に潜在空間での反復的な洗練を行うことで、メモリ使用量を一定に保ちながら計算量を適応的に増やせるVLAアーキテクチャを提案した。
- FailSafe: VLAモデルの失敗推論と回復VLA2025/10/1
VLAモデルが実行中に遭遇する失敗を検出し、回復動作を生成できるようにする失敗生成・回復システムFailSafeを提案し、LLaVA-OV-7Bを微調整してロボットアームの失敗検出・回復性能を向上させた。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- SAM2Act:視覚基盤モデルと記憶アーキテクチャを統合したロボットマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルを活用したマルチビューロボット方策SAM2Actを提案し、RLBenchで86.8%の成功率を達成。さらに記憶バンクを備えたSAM2Act+と記憶依存タスク評価用ベンチマークMemoryBenchを導入し、94.3%の成功率を実現した。