Reuben Tan
Microsoft Research
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAタスク計画対話的プランニング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Rho: 効率的に適応可能なVLAモデルの基盤VLA2026/9/29
双腕マニピュレーション向けのオープンウェイトVLAモデル群「Rho」を提案し、3つの実機での少量データ適応と、15エピソード程度の修正フィードバックによるオンライン適応を実現した。
- 実世界における空間的に基づく長期的タスク計画タスク計画2026/3/1
ロボット操作のための空間的に実行可能な長期的行動計画を評価するベンチマークを新たに構築し、実世界のロボットビデオを用いた自動データ生成手法を提案して、VLMの計画能力を向上させる。
- AsgardBench:最小限のフィードバック下での視覚に基づく対話的プランニングの評価対話的プランニング2026/3/1
視覚に基づく高レベルの行動系列生成と対話的プランニングを評価するベンチマークを提案し、実行中の視覚観察に基づくプラン適応に焦点を当てる。
- MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現VLA2025/7/1
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
- Magma: マルチモーダルAIエージェントのための基盤モデルVLA2025/2/1
画像・動画・ロボットデータを統合的に学習し、UI操作からロボットマニピュレーションまでこなすマルチモーダル基盤モデルを提案。
- SAT: マルチモーダル言語モデルのための動的空間適性トレーニングVLA2024/12/1
3Dシミュレータを用いて静的・動的な空間推論を含む17.5万件のQAペアと2万シーンからなるデータセットSATを構築し、マルチモーダル言語モデルの空間認識能力を訓練する手法を提案した。
- 動画からの潜在行動事前学習VLA2024/10/1
ロボットの行動ラベルなしでインターネット規模の動画からVLAモデルを事前学習する手法を提案し、実世界のマニピュレーションタスクで既存手法を上回る性能を示した。