Mingyang Sun
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAマニピュレーションsim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデルVLA2026/7/1
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
- 分析的概念中心メモリによるエージェント型身体操作マニピュレーション2026/6/1
長期的な身体操作タスクのために、物体の状態やスキルを構造化された概念で記憶・検索するメモリフレームワークを提案し、タスク成功率や汎化性能を向上させた。
- RealD²iff: 深度拡散によるロボットマニピュレーションの実世界ギャップの橋渡しsim2real2025/11/1
拡散モデルでシミュレーションのクリーンな深度から実機のようなノイズ深度を合成し、実機データ収集なしでゼロショットsim2realマニピュレーションを実現した研究。
- VLMの洞察と精密マニピュレーションを繋ぐ実行可能な解析概念マニピュレーション2025/10/1
VLMの高レベル推論を、数学的に定義された「実行可能な解析概念」を介して把持姿勢や力方向・軌道計画に変換し、未学習の物体でも精密操作を可能にするフレームワークGRACEを提案。
- VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニングVLA2025/10/1
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
- スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策VLA2024/12/1
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。