Mingming Gong
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA物理モデル学習水中ナビゲーション3D空間推論SLAM
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SEES: 失敗から自己進化するVLAポリシー適応システムVLA2026/9/26
長期的タスクで失敗するVLAポリシーを、専門家の追加デモなしに自己改善するシステム。失敗した原子スキルを自動検出し、シミュレーションでRL学習してポリシーを進化させる。
- ビデオからの物理法則抽出:最小軌道条件下での時間不変2次ODEの識別可能性物理モデル学習2026/5/27
生のピクセルから物理法則のパラメータを一意に復元できる条件を理論的に解明し、エンコーダのみのパイプラインで減衰系の識別可能性を証明した論文。
- KineVLA: 運動学を考慮した視覚言語行動モデルと二段階行動分解VLA2026/3/1
言語指示に運動学的属性(方向、軌道、姿勢、相対変位など)を細かく組み込んだ新しいVLAタスクを提案し、目標の不変性と運動学的可変性を分離する二段階行動表現と推論トークンを持つKineVLAフレームワークを導入した。シミュレーションと実機で精度・制御性・汎化性が向上することを示した。
- PosA-VLA: 姿勢条件付きアンカー注意による行動生成の強化VLA2025/12/1
VLAモデルの視覚注意を姿勢情報で誘導し、タスクに関連する領域に集中させることで、冗長な動きを抑え精密で効率的な行動生成を実現した研究。
- DUViN: 知識転移した深度特徴による拡散モデルベース水中視覚ナビゲーション水中ナビゲーション2025/9/1
空中データで学習した拡散モデルベースの視覚ナビゲーション方策を、水中深度推定タスクで再学習した特徴抽出器と組み合わせることで、地図なしで未知の水中環境を4自由度で自律航行できるようにした研究。
- SURPRISE3D: 複雑な3Dシーンにおける空間理解と推論のためのデータセット3D空間推論2025/7/1
物体名に頼らず空間関係のみを問う20万件超の視覚言語ペアを構築し、3Dシーンでの空間推論を評価するベンチマークを提案した。
- PanoSLAM: ガウシアンSLAMによるパノプティック3Dシーン再構成SLAM2025/1/1
3Dガウシアンスプラッティングを基盤に、RGB-D動画から幾何・意味・インスタンス情報を統合したパノプティック3D再構成をオンラインで実現するSLAMシステムを提案。
- A Relational Intervention Approach for Unsupervised Dynamics Generalization in Model-Based Reinforcement Learning2022/6/1