Xiang Chen
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SurgVLA-Bench: 腹腔鏡手術ロボットのための視覚言語行動モデル評価ベンチマークVLA/評価ベンチマーク2026/6/28
腹腔鏡手術ロボット向けのVLAモデルを評価する初の包括的ベンチマークを提案し、SurRoLシミュレーション上で階層的タスクと多次元評価フレームワークを構築した。
- FreqCache: 適応的な周波数ガイド型トークンキャッシングによる身体化VLNモデルの高速化VLA2026/4/1
VLNモデルの計算コストを削減するため、周波数領域の特性を利用してトークンキャッシュの構築・更新・適応調整を行うFreqCacheを提案した。
- 2Dか3Dか:VLAモデルにおける顕著性を支配するのはどちらか?--モダリティ顕著性を考慮した三段階トークンプルーニングフレームワークVLA/モデル圧縮2026/4/1
マルチビジュアルモーダルVLAモデル向けに、2D/3Dモダリティの顕著性差を分析し、三段階のトークンプルーニング手法を提案。最大2.55倍の推論高速化を実現。
- RAPID: 多様なVLAモデルのための冗長性認識・互換性最適なエッジ・クラウド分割推論VLA/エッジ・クラウド協調推論2026/3/1
VLAモデルの推論コスト削減のため、冗長性を考慮し互換性を最適化したエッジ・クラウド分割推論フレームワークRAPIDを提案し、最大1.73倍の高速化を実現した。
- VLN-Cache: 視覚・意味ダイナミクスを考慮したVLNモデルのトークンキャッシングVLA2026/3/1
VLNタスクで大規模視覚言語モデルの推論コストを削減するため、視点移動によるトークン位置ずれとタスク進行に伴う意味的変化を考慮したトークンキャッシング手法を提案した。
- KERV: 身体化VLAモデルのための運動学的修正投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
- DyQ-VLA: 身体化視覚言語行動モデルのための時間動的認識量子化VLA/量子化2026/3/1
VLAモデルの推論コストを削減するため、時間的な感度に応じてビット幅を動的に切り替える量子化フレームワークDyQ-VLAを提案した。
- HeiSD: 運動学的認識を備えた身体化視覚言語行動モデルのためのハイブリッド投機的復号VLA/推論高速化2026/3/1
VLAモデルの推論を高速化するため、ドラフタベースと検索ベースの投機的復号を統合したハイブリッド手法HeiSDを提案し、検証スキップ機構と運動学に基づく融合指標により高速化と成功率を両立した。
- RoboECC: VLAモデルのための多要素対応エッジ・クラウド協調配置VLA/エッジクラウド協調2026/3/1
VLAモデルの推論コストを削減するため、モデル構造とネットワーク状態を考慮したエッジ・クラウド協調配置フレームワークRoboECCを提案し、最適な分割点の特定と帯域変動への適応により最大3.28倍の高速化を実現した。
- EBT-Policy:エネルギーが創発的な物理推論能力を解き放つVLA2025/10/1
拡散ポリシーに代わるエネルギー・ベースのポリシーEBT-Policyを提案し、少ない計算で高精度・高ロバストなロボット制御を実現、失敗からのゼロショット回復などの創発能力を示した。
- FastViDAR: 代替階層アテンションによるリアルタイム全周深度推定深度推定2025/9/1
4台の魚眼カメラ入力から360度深度マップを生成するフレームワークを提案し、組込みハードウェアで20FPSを達成した。
- Tenma: 拡散トランスフォーマーによる堅牢なクロスエンボディメントロボットマニピュレーションマニピュレーション2025/9/1
異なるロボットの状態・行動空間を共有潜在空間に写像する正規化器と拡散トランスフォーマーを組み合わせ、両腕マニピュレーションを軽量かつ高精度・高汎化で実現した研究。
- EaqVLA: 視覚-言語-行動モデルのための符号化整合量子化VLA2025/5/27
VLAモデルの量子化におけるトークン不整合問題を分析し、符号化整合を考慮した混合精度量子化フレームワークを提案。既存手法より高い量子化性能と加速を実現。
- 空間認識型ロボット把持:汎用把持制御ポリシーマニピュレーション2025/5/1
単眼深度推定と6自由度把持プロンプトを統合した空間表現と拡散ポリシーにより、環境変化に頑健な汎用ロボット把持を実現した。
- CoinRobot: 物理的知能のための汎用エンドツーエンドロボット学習マニピュレーション2025/3/1
多様なロボットや環境に適応できる汎用エンドツーエンド学習フレームワークを提案し、7つのマニピュレーションタスクで拡散モデルベースの手法が高い性能と汎化性を示した。
- RoboGrasp: ロバストなロボット制御のための汎用把持ポリシーマニピュレーション2025/2/1
事前学習済みの把持検出モデルと拡散ベースのロボット学習を統合し、物体検出・セグメンテーションによる視覚誘導で把持の精度と汎化性を高める汎用把持ポリシーを提案した。
- エンドツーエンドロボット学習のための空間的視覚知覚VLA2024/11/1
単眼深度推定と新たな画像拡張AugBlenderを組み合わせ、照明変化など環境変動に頑健な映像ベースの空間知覚フレームワークを提案し、模倣学習の汎化性能を向上させた。
- Loop Closure Detection Based on Object-level Spatial Layout and Semantic Consistency2023/4/1
- Adversarial Evaluation of Autonomous Vehicles in Lane-Change Scenarios2020/4/1