Didi Zhu
収録論文 2本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- ロボットマニピュレーションにおける生成AI:サーベイマニピュレーション2025/3/1
GAN・VAE・拡散モデルなどの生成モデルをロボットマニピュレーションに応用する研究を、データ生成から方策学習まで階層的に整理したサーベイ。