Yilei Zhong
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- Evo-1: 意味的整合性を保つ軽量Vision-Language-ActionモデルVLA2025/11/1
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
- Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデルVLA2025/7/1
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。