Jianwei Yang
収録論文 7本 ・ フィジカルAI/ロボット学習
言語エージェントVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 初期経験によるエージェント学習言語エージェント2025/10/9
エージェント自身の行動から得られる相互作用データを報酬なしで活用し、世界モデリングと自己内省によって言語エージェントを訓練する手法を提案した。
- MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現VLA2025/7/1
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
- Magma: マルチモーダルAIエージェントのための基盤モデルVLA2025/2/1
画像・動画・ロボットデータを統合的に学習し、UI操作からロボットマニピュレーションまでこなすマルチモーダル基盤モデルを提案。
- TraceVLA:視覚トレースプロンプトで汎用ロボットポリシーの時空間認識を強化VLA2024/12/1
状態行動軌跡を視覚的にエンコードする視覚トレースプロンプトを導入し、VLAモデルの時空間認識を改善。15万件の操作軌跡でOpenVLAを微調整したTraceVLAは、シミュレーションと実機で大幅な性能向上を達成。
- 動画からの潜在行動事前学習VLA2024/10/1
ロボットの行動ラベルなしでインターネット規模の動画からVLAモデルを事前学習する手法を提案し、実世界のマニピュレーションタスクで既存手法を上回る性能を示した。
- Embodied Visual Recognition2019/4/1
- Visual Curiosity: Learning to Ask Questions to Learn Visual Recognition2018/10/1