Zhihao Mao
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA/モデル圧縮VLAVLA/推論高速化
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 2Dか3Dか:VLAモデルにおける顕著性を支配するのはどちらか?--モダリティ顕著性を考慮した三段階トークンプルーニングフレームワークVLA/モデル圧縮2026/4/1
マルチビジュアルモーダルVLAモデル向けに、2D/3Dモダリティの顕著性差を分析し、三段階のトークンプルーニング手法を提案。最大2.55倍の推論高速化を実現。
- FreqCache: 適応的な周波数ガイド型トークンキャッシングによる身体化VLNモデルの高速化VLA2026/4/1
VLNモデルの計算コストを削減するため、周波数領域の特性を利用してトークンキャッシュの構築・更新・適応調整を行うFreqCacheを提案した。
- VLN-Cache: 視覚・意味ダイナミクスを考慮したVLNモデルのトークンキャッシングVLA2026/3/1
VLNタスクで大規模視覚言語モデルの推論コストを削減するため、視点移動によるトークン位置ずれとタスク進行に伴う意味的変化を考慮したトークンキャッシング手法を提案した。
- KERV: 身体化VLAモデルのための運動学的修正投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
- HeiSD: 運動学的認識を備えた身体化視覚言語行動モデルのためのハイブリッド投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、ドラフタベースと検索ベースの投機的復号を統合したハイブリッド手法HeiSDを提案し、検証スキップ機構と運動学に基づく融合指標により高速化と成功率を両立した。