Shuai Chen
収録論文 7本 ・ フィジカルAI/ロボット学習
医療ロボティクスVLA/拡散モデル/ファインチューニングVLA3D視覚言語理解3D-LLM位置推定
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 想像しながらスキャン:ロボット超音波ナビゲーションのためのシーングラフ世界モデル医療ロボティクス2026/9/26
解剖構造をシーングラフで表現し、プローブ動作に伴う将来の視野変化を予測する世界モデルを提案。CTから学習データを生成し、胆嚢・膵臓の目標視野への自律ナビゲーションを実現した。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- DFM-VLA: 離散フローマッチングによる反復的な行動洗練でロボットマニピュレーションを実現VLA2026/3/1
行動トークンを反復的に洗練する離散フローマッチング型VLAを提案し、初期のトークン誤りを後から修正できるようにしてマニピュレーション精度を向上させた。
- 3D大規模言語モデルは本当に3D空間関係を理解しているのか?3D視覚言語理解2026/3/1
既存の3D-LLMがテキストの手がかりに頼っており、3D空間理解を正しく評価できていない問題を指摘し、より厳密なベンチマークReal-3DQAと3D視覚情報を活用する学習手法を提案した。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- LLMが3D世界へ:マルチモーダル大規模言語モデルによる3Dタスクのサーベイとメタ分析3D-LLM2024/5/1
LLMを3D空間データに統合する3D-LLMの研究を、点群からNeRFまでの表現、シーン理解・対話・ナビゲーションなどのタスク、課題と将来展望まで体系的に整理したサーベイ。
- HR-APR: 不確実性推定と階層的洗練によるAPR非依存のカメラ位置推定フレームワーク位置推定2024/2/1
単眼画像からカメラ姿勢を推定するAPRに対し、クエリとデータベース特徴のコサイン類似度で不確実性を推定し、姿勢洗練に活用するAPR非依存フレームワークを提案。計算コストを削減しつつSOTA精度を維持。