Andrew Tao
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
- Improving Semantic Segmentation via Video Propagation and Label Relaxation2018/12/1