Humphrey Shi
収録論文 3本 ・ フィジカルAI/ロボット学習
VLAWモデルVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WorldBagel:視覚・言語・行動・世界モデルの統合の力VLAWモデル2026/7/3
統合型マルチモーダルモデルを用いて、ロボット操作タスクにおける世界モデルの性能を向上させる新しいフレームワークを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。