Siyu Zhu
収録論文 10本 ・ フィジカルAI/ロボット学習
VLA触覚/操作自動運転/VLA6D姿勢推定
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WAM-Diff2: 階層的AR-to-Diffusion蒸留による高効率自動運転VLAVLA2026/8/1
事前学習済みの自己回帰型VLAモデルを、並列実行可能な拡散モデルへ変換するための3段階の階層的蒸留戦略を提案し、推論速度を大幅に向上させつつ性能を維持する。
- 3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与するVLA2026/6/3
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
- UniTacVLA: 視覚言語行動モデルにおける統合触覚理解と予測触覚/操作2026/6/1
接触を伴う器用な操作のために、触覚信号を動的な相互作用の手がかりとして扱い、現在の触覚状態と将来の接触変化を統合的にモデル化するフレームワークを提案。触覚連鎖思考と粗密な将来触覚予測により状態・動態を考慮した事前知識を構築し、実時間と予測触覚を組み合わせた混合制御で高精度な操作を実現。
- WAM-Flow: 離散フローマッチングによる並列粗密運動計画自動運転/VLA2025/12/1
自動運転の軌道計画を離散フローマッチングで並列生成するVLAモデルを提案し、NAVSIMで高精度を達成した。
- WAM-Diff: マスク拡散とMoE・オンライン強化学習を統合した自動運転VLAフレームワークVLA2025/12/1
自動運転の軌道生成にマスク拡散モデルを適用し、スパースMoEとオンライン強化学習を組み合わせることで、NAVSIMベンチマークで高い性能を達成したVLAフレームワーク。
- OV9D: オープンボキャブラリなカテゴリレベル9D物体姿勢・サイズ推定6D姿勢推定2024/3/1
任意の新規カテゴリのテキスト記述から、観測画像中の物体の位置・向き・サイズを推定するオープンセット問題に取り組み、大規模合成データセットOO3D-9DとDinoV2・拡散モデルを活用したNOCS推定フレームワークを提案した。
- Compact 3D Map-Based Monocular Localization Using Semantic Edge Alignment2021/3/1
- AR Mapping: Accurate and Efficient Mapping for Augmented Reality2021/3/1
- Single-Shot is Enough: Panoramic Infrastructure Based Calibration of Multiple Cameras and 3D LiDARs2021/3/1
- UniFuse: Unidirectional Fusion for 360$^{\circ}$ Panorama Depth Estimation2021/2/1