Zihao Zheng
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 2Dか3Dか:VLAモデルにおける顕著性を支配するのはどちらか?--モダリティ顕著性を考慮した三段階トークンプルーニングフレームワークVLA/モデル圧縮2026/4/1
マルチビジュアルモーダルVLAモデル向けに、2D/3Dモダリティの顕著性差を分析し、三段階のトークンプルーニング手法を提案。最大2.55倍の推論高速化を実現。
- FreqCache: 適応的な周波数ガイド型トークンキャッシングによる身体化VLNモデルの高速化VLA2026/4/1
VLNモデルの計算コストを削減するため、周波数領域の特性を利用してトークンキャッシュの構築・更新・適応調整を行うFreqCacheを提案した。
- DyQ-VLA: 身体化視覚言語行動モデルのための時間動的認識量子化VLA/量子化2026/3/1
VLAモデルの推論コストを削減するため、時間的な感度に応じてビット幅を動的に切り替える量子化フレームワークDyQ-VLAを提案した。
- RAPID: 多様なVLAモデルのための冗長性認識・互換性最適なエッジ・クラウド分割推論VLA/エッジ・クラウド協調推論2026/3/1
VLAモデルの推論コスト削減のため、冗長性を考慮し互換性を最適化したエッジ・クラウド分割推論フレームワークRAPIDを提案し、最大1.73倍の高速化を実現した。
- HeiSD: 運動学的認識を備えた身体化視覚言語行動モデルのためのハイブリッド投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、ドラフタベースと検索ベースの投機的復号を統合したハイブリッド手法HeiSDを提案し、検証スキップ機構と運動学に基づく融合指標により高速化と成功率を両立した。
- RoboECC: VLAモデルのための多要素対応エッジ・クラウド協調配置VLA/エッジクラウド協調2026/3/1
VLAモデルの推論コストを削減するため、モデル構造とネットワーク状態を考慮したエッジ・クラウド協調配置フレームワークRoboECCを提案し、最適な分割点の特定と帯域変動への適応により最大3.28倍の高速化を実現した。
- 視野拡大と自律飛行のための自旋回転型三ローターUAVUAV2026/3/1
追加センサーなしで機体を自転させてカメラやLiDARの視野を広げる三ローターUAVを提案し、外乱補償制御で安定飛行と高精度軌道追従を実証した。
- KERV: 身体化VLAモデルのための運動学的修正投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
- VLN-Cache: 視覚・意味ダイナミクスを考慮したVLNモデルのトークンキャッシングVLA2026/3/1
VLNタスクで大規模視覚言語モデルの推論コストを削減するため、視点移動によるトークン位置ずれとタスク進行に伴う意味的変化を考慮したトークンキャッシング手法を提案した。
- EaqVLA: 視覚-言語-行動モデルのための符号化整合量子化VLA2025/5/27
VLAモデルの量子化におけるトークン不整合問題を分析し、符号化整合を考慮した混合精度量子化フレームワークを提案。既存手法より高い量子化性能と加速を実現。