Xing Hu
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA/操作VLA/推論高速化ロボット知覚ベンチマークVLA3D物体検出
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PrimitiveVLA: 再利用可能な運動プリミティブ学習による効率的で汎用的なロボット操作VLA/操作2026/5/1
VLAモデルのデータ効率と汎化を改善するため、デモを再利用可能な運動プリミティブに分解し、推論時に組み立てるフレームワークを提案した。
- Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワークVLA/推論高速化2026/5/1
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- KARMA:長期・短期記憶システムで身体性AIエージェントを強化VLA2024/9/1
長期記憶に3Dシーングラフ、短期記憶に物体の位置・状態変化を記録する二重記憶構造をLLMに組み込み、家庭内の長系列タスク計画の成功率と効率を大幅に改善した。
- 情報エントロピー誘導型高さ認識ヒストグラムによる量子化親和的なピラーフィーチャエンコーダ3D物体検出2024/5/1
ピラーベース3D物体検出の特徴エンコーディングにおいて、高さ方向の情報損失と数値分布の偏りを情報エントロピーで誘導するヒストグラム表現で解決し、量子化しやすく高性能なPillarHistを提案した論文。