Sitong Mao
Zhejiang University
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CR-VLA-Force: 制御認識型コンプライアンスVLAモデルによる頑健な接触豊富なロボット操作の学習VLA/力覚制御2026/9/5
力覚認識を統合したVLAモデルが精密な力追従と迅速な調整に弱い問題を解決するため、マルチモーダルMoEと多段階訓練、適応コンプライアンス制御を備えたCC-VLAフレームワークを提案し、実機実験で有効性を示した。
- 連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考ナビゲーション2026/9/3
VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- HyperSim: ロバストなロボット操作のための包括的シミュレーションから実世界へのフレームワークsim2real2026/5/1
シミュレーションから実世界への転移を改善するため、高忠実度環境合成、敵対的軌道生成、シミュレーションと実世界の共学習を組み合わせた包括的フレームワークHyperSimを提案し、実世界タスクで高い成功率を達成した。
- ETP-R1: 強化学習ファインチューニングによるトポロジカル計画の進化 — 連続環境における視覚言語ナビゲーションVLA2025/12/1
連続環境での視覚言語ナビゲーション(VLN-CE)において、グラフベースのモデルに大規模データと強化学習ファインチューニングを適用し、R2R-CEで最先端性能を達成した研究。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- 生涯ロボット学習のための動的混合プログレッシブパラメータ効率エキスパートライブラリ生涯学習2025/6/1
低ランクエキスパートのライブラリを漸進的に構築し、軽量ルーターで動的に組み合わせることで、破滅的忘却を抑えつつ生涯にわたるロボット学習を効率化する手法を提案。
- PanopticSplatting: エンドツーエンドのパノプティックガウシアンスプラッティング3Dシーン理解2025/3/1
ガウシアンスプラッティングを用いたオープンボキャブラリなパノプティック再構成を、クエリ誘導型セグメンテーションとラベルブレンディングによりエンドツーエンドで実現した手法。
- PanopticRecon: オープン語彙インスタンスセグメンテーションを活用したゼロショットパノプティック再構成3Dシーン理解2024/7/1
RGB-D画像から、オープン語彙インスタンスセグメンテーションを利用して未知環境でも3Dパノプティック再構成をゼロショットで行う手法を提案。部分ラベルの伝播と3DインスタンスグラフによるID統合で課題を解決した。
- SCALE: 新奇性推定による移動ロボットの自己修正型視覚ナビゲーション視覚ナビゲーション2024/4/1
オフライン強化学習と新奇性推定を組み合わせ、未知の観測に直面しても人間の介入なしに自己修正して経路を回復する視覚ナビゲーション手法を提案した。
- NF-Atlas: Multi-Volume Neural Feature Fields for Large Scale LiDAR Mapping2023/4/1