Renshan Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SemanticVLA: 効率的なロボット操作のための意味論的整合スパース化と強化VLA2025/11/1
視覚言語行動モデルの知覚冗長性と指示-視覚の浅い整合を解決するため、意味論に基づく視覚プルーニングと階層的融合、行動結合を導入し、LIBEROでOpenVLAを21.1%上回る性能と効率を実現した。
- CogVLA: 指示駆動型ルーティングとスパース化による認知整合型視覚-言語-行動モデルVLA2025/8/1
人間のマルチモーダル協調に着想を得て、指示に応じて視覚トークンを選択・圧縮し、行動意図に基づき不要トークンを刈り込む3段階のVLAアーキテクチャを提案。学習コストと推論遅延を大幅に削減しつつ、LIBEROベンチマークで97.4%の成功率を達成した。
- ロボットマニピュレーションのための大規模VLMベース視覚-言語-行動モデル:サーベイVLA2025/8/1
大規模視覚言語モデルを基盤とした視覚-言語-行動(VLA)モデルによるロボットマニピュレーション研究を、アーキテクチャの分類や関連分野との統合、今後の方向性を含めて初めて体系的にレビューしたサーベイ論文。
- A Novel Dual Quaternion Based Dynamic Motion Primitives for Acrobatic Flight2021/7/1