Mohit Bansal
収録論文 16本 ・ フィジカルAI/ロボット学習
動画生成/マニピュレーションビデオ理解ナビゲーションVLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego2Act: 一人称視点動画生成における目標指向マニピュレーションの評価動画生成/マニピュレーション2026/10/1
一人称視点の動画生成モデルが、高レベルの目標から多段階の物体操作をどれだけ現実的にシミュレートできるかを評価するベンチマークEgo2Actと、参照不要の評価器Ego2ActJudgeを提案した。
- EgoMemReason: 長時間の自己中心視点映像理解のための記憶駆動型推論ベンチマークビデオ理解2026/5/11
数日間にわたる自己中心視点映像の理解を評価する新しいベンチマークを提案し、エンティティ記憶、イベント記憶、行動記憶の3種類の記憶に基づく推論をテストする。
- IndustryNav: 動的産業環境における身体性エージェントの空間推論ベンチマークナビゲーション2025/11/1
動的な倉庫を再現したUnity環境で、視覚言語モデルによる能動的なナビゲーションと空間推論を評価する初の産業向けベンチマークを提案し、最先端モデルの安全性や計画能力の課題を明らかにした。
- Prune-Then-Plan: 身体性質問応答における安定したフロンティア探索のためのステップレベル校正VLA2025/11/1
VLMの過信によるフロンティア振動を抑えるため、ステップレベルで候補を枝刈りしてからカバレッジベースのプランナに決定を委ねる枠組みを提案し、EQAの探索効率と回答品質を改善した。
- 一度きりの人生で学ぶ:未誘導探索から確率的環境の記号的世界モデルを推論する世界モデル2025/10/14
人間の助けなしに一度きりの探索で複雑な確率的環境の遷移をプログラムとして学習するフレームワークOneLifeを提案し、状態ランキングと忠実度で評価した。
- VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマーVLA2025/10/1
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
- SAME: 状態適応型エキスパート混合による汎用言語誘導視覚ナビゲーションの学習ナビゲーション2024/12/1
異なる粒度の言語指示による7つのナビゲーションタスクを統一的に扱うため、状態に応じて専門家を切り替えるMixture of ExpertsモデルSAMEを提案し、タスク特化型エージェントに匹敵する性能を実現した。
- On the Limits of Evaluating Embodied Agent Model Generalization Using Validation Sets2022/5/1
- ArraMon: A Joint Navigation-Assembly Instruction Interpretation Task in Dynamic Environments2020/11/1
- Enabling Robots to Understand Incomplete Natural Language Instructions Using Commonsense Reasoning2019/4/1
- Source-Target Inference Models for Spatial Instruction Understanding2017/7/1
- Efficient Generation of Motion Plans from Attribute-Based Natural Language Instructions Using Dynamic Constraint Mapping2017/7/1
- Navigational Instruction Generation as Inverse Reinforcement Learning with Neural Machine Translation2016/10/1
- Learning Articulated Motion Models from Visual and Lingual Signals2015/11/1
- Accurate Vision-based Vehicle Localization using Satellite Imagery2015/10/1
- Listen, Attend, and Walk: Neural Mapping of Navigational Instructions to Action Sequences2015/6/1