Soujanya Poria
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA身体性プランニング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MemBodied: 視覚-言語-行動モデルのための再帰的連想記憶VLA2026/9/23
VLAモデルに固定サイズのエピソード記憶を導入し、過去の観測を保持せずに履歴依存のマニピュレーションタスクを高成功率で実現した。
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- NORA-1.5:世界モデルと行動に基づく選好報酬で訓練された視覚-言語-行動モデルVLA2025/11/1
事前学習済みNORAにフローマッチング行動エキスパートを追加し、世界モデルと正解からの逸脱を報酬とするDPOで事後学習することで、シミュレーションと実機の両方で信頼性と汎化性能を向上させたVLAモデル。
- 視覚-言語-行動モデルの未来を導く10の未解決課題VLA2025/11/1
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
- グラウンディングからマニピュレーションへ:具現化ロボットシステムにおける基盤モデル統合のケーススタディVLA2025/5/1
ロボットシステム構築の3つのパラダイム(VLAモデル、VLMパイプライン、マルチモーダルLLMパイプライン)を、複雑な指示理解と物体操作の2つのケーススタディで評価し、汎化とデータ効率のトレードオフを明らかにした。
- NORA: 実世界タスク向け小型オープンソース汎用視覚言語行動モデルVLA2025/4/1
3Bパラメータのマルチモーダルモデルを基盤に97万件の実ロボット実演で学習し、大規模VLAより低計算コストで高いタスク性能を実現した。
- Emma-X: 接地された思考連鎖と先読み空間推論を備えた身体性マルチモーダル行動モデルVLA2024/12/1
ロボット操作データセットBridgeV2を基に階層的な身体性データセットを構築し、把持状態と運動軌跡に基づく軌跡分割戦略を導入することで、接地された思考連鎖と先読み空間推論を可能にするVLAモデルEmma-Xを提案した。
- Can-Do! 大規模マルチモーダルモデルのための身体性プランニングデータセットとニューロシンボリック基盤フレームワーク身体性プランニング2024/9/1
身体性プランニングを評価する400件のマルチモーダルデータセットCan-Doを構築し、知覚状態に基づくニューロシンボリックな計画生成フレームワークNeuroGroundを提案した。