Feilong Tang
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- 統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデルVLA2025/11/1
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
- ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚VLA2025/8/1
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。