Shunbo Zhou
Zhejiang University
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- CR-VLA-Force: 制御認識型コンプライアンスVLAモデルによる頑健な接触豊富なロボット操作の学習VLA/力覚制御2026/9/5
力覚認識を統合したVLAモデルが精密な力追従と迅速な調整に弱い問題を解決するため、マルチモーダルMoEと多段階訓練、適応コンプライアンス制御を備えたCC-VLAフレームワークを提案し、実機実験で有効性を示した。
- 連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考ナビゲーション2026/9/3
VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。
- SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデルVLA2026/8/1
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
- HiL-ResRL: 人間参加型残差強化学習によるモデル非依存のファインチューニングアダプタロボットマニピュレーション2026/6/1
模倣学習のVLAモデルに対して、モデル非依存でプラグイン可能な残差ポリシーを強化学習で訓練し、実ロボットで1.5時間の学習で成功率95%以上を達成するファインチューニング手法を提案した。
- HyperSim: ロバストなロボット操作のための包括的シミュレーションから実世界へのフレームワークsim2real2026/5/1
シミュレーションから実世界への転移を改善するため、高忠実度環境合成、敵対的軌道生成、シミュレーションと実世界の共学習を組み合わせた包括的フレームワークHyperSimを提案し、実世界タスクで高い成功率を達成した。
- ETP-R1: 強化学習ファインチューニングによるトポロジカル計画の進化 — 連続環境における視覚言語ナビゲーションVLA2025/12/1
連続環境での視覚言語ナビゲーション(VLN-CE)において、グラフベースのモデルに大規模データと強化学習ファインチューニングを適用し、R2R-CEで最先端性能を達成した研究。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- 生涯ロボット学習のための動的混合プログレッシブパラメータ効率エキスパートライブラリ生涯学習2025/6/1
低ランクエキスパートのライブラリを漸進的に構築し、軽量ルーターで動的に組み合わせることで、破滅的忘却を抑えつつ生涯にわたるロボット学習を効率化する手法を提案。
- PanopticSplatting: エンドツーエンドのパノプティックガウシアンスプラッティング3Dシーン理解2025/3/1
ガウシアンスプラッティングを用いたオープンボキャブラリなパノプティック再構成を、クエリ誘導型セグメンテーションとラベルブレンディングによりエンドツーエンドで実現した手法。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。
- PanopticRecon: オープン語彙インスタンスセグメンテーションを活用したゼロショットパノプティック再構成3Dシーン理解2024/7/1
RGB-D画像から、オープン語彙インスタンスセグメンテーションを利用して未知環境でも3Dパノプティック再構成をゼロショットで行う手法を提案。部分ラベルの伝播と3DインスタンスグラフによるID統合で課題を解決した。
- SCALE: 新奇性推定による移動ロボットの自己修正型視覚ナビゲーション視覚ナビゲーション2024/4/1
オフライン強化学習と新奇性推定を組み合わせ、未知の観測に直面しても人間の介入なしに自己修正して経路を回復する視覚ナビゲーション手法を提案した。
- NF-Atlas: Multi-Volume Neural Feature Fields for Large Scale LiDAR Mapping2023/4/1
- Coordinating Large-Scale Robot Networks with Motion and Communication Uncertainties for Logistics Applications2019/4/1
- SeqLPD: Sequence Matching Enhanced Loop-Closure Detection Based on Large-Scale Point Cloud Description for Self-Driving Vehicles2019/4/1