Zhongrui Wang
Southern University of Science and Technology
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA深度推定マニピュレーション視覚ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- D$^2$-VLA:長期動的マニピュレーションのための二重記憶・二重周波数視覚言語行動モデルVLA2026/9/28
事前学習済みVLAのKVキャッシュに二重記憶と二重周波数制御を組み込み、動く物体を扱う長期タスクで過去の視覚手がかりを保持しつつ応答できるようにした。
- AnyStep-WAM: 予算整合蒸留と適応推論によるワールドアクションモデルVLA2026/9/27
ワールドアクションモデルのノイズ除去ステップ数をタスクの難易度に応じて適応的に配分し、成功率を維持しつつ計算量を最大85%削減するフレームワークを提案。
- OptiGeo: 光学的に困難なシーンにおける身体化知覚のための効率的な単眼幾何学深度推定2026/8/30
透明・反射・鏡面環境での単眼深度推定の信頼性を向上させるため、センサ由来のバイアスを補正する学習フレームワークOptiGeoを提案した。
- 想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行マニピュレーション2026/5/1
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
- MG-Nav: 疎な空間メモリによる二段階スケールの視覚ナビゲーション視覚ナビゲーション2025/11/1
領域ごとに多視点のキーフレームと物体意味を集約した疎な空間メモリグラフを用い、大域的な記憶誘導計画と局所的な幾何制御を組み合わせてゼロショット視覚ナビゲーションを実現した研究。