Fuxiao Liu
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 大規模視覚言語モデルの最新動向:アラインメント、ベンチマーク、評価、課題に関するサーベイVLA2025/1/1
2025年までの主要な視覚言語モデル(VLM)のモデル情報、アーキテクチャの変遷とアラインメント手法、ベンチマークと評価指標、幻覚や公平性などの課題を体系的にまとめたサーベイ論文。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
- LLM/VLM制御ロボティクスの脆弱性VLA2024/2/1
LLMやVLMで制御されるロボットが入力のわずかな変化に弱く、タスク成功率が最大22.2%低下することを実験で示した研究。